{"as_of":"2026-08-23T06:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a711fccdf663730e221a50755011e70533c84a78e0ef7107379d2ec9bd2dc34","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:41:33.683491Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T15:27:04.228144Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T15:27:04.347986Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"cited_work":{"arxiv_id":"2501.00958","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00958","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2.5 years in class: A multimodal textbook for vision-language pretraining","venue":null,"work_id":"0c24ef2e-2a71-4a48-8d77-55f8efbc2e06","year":2025},"citing_paper":{"arxiv_id":"2506.20670","last_updated":"2025-06-25T17:59:42Z","snapshot_observed_at":"2026-08-14T00:24:35.202988Z","submitted_at":"2025-06-25T17:59:42Z","title":"MMSearch-R1: Incentivizing LMMs to Search","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-16T15:27:04.228144Z"},"links":{"cited_paper":"/paper/2501.00958","citing_paper":"/paper/2506.20670"},"observation_digest":"sha256:526cce264e359210024d87c1a857df404f729c50dbca628222ffb0438b98fef8","observation_id":"07cc1ea5-4d39-47ed-aa23-194287dc94d8","resolution":{"observed_at":"2026-05-16T15:27:04.350557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"cited_work":{"arxiv_id":"2501.00958","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00958","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2.5 years in class: A multimodal textbook for vision-language pretraining","venue":null,"work_id":"0c24ef2e-2a71-4a48-8d77-55f8efbc2e06","year":2025},"citing_paper":{"arxiv_id":"2603.09677","last_updated":"2026-04-08T07:57:35Z","snapshot_observed_at":"2026-08-14T19:39:31.611087Z","submitted_at":"2026-03-10T13:46:32Z","title":"Logics-Parsing-Omni Technical Report","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T13:37:44.189839Z"},"links":{"cited_paper":"/paper/2501.00958","citing_paper":"/paper/2603.09677"},"observation_digest":"sha256:f03f1143a533fab9c70d9ba1bdd421b9d5f25db5983f8c78846697a8a58452b9","observation_id":"94d03705-9203-4199-b635-f0431c84279a","resolution":{"observed_at":"2026-05-15T13:40:01.727666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"cited_work":{"arxiv_id":"2501.00958","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00958","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2.5 years in class: A multimodal textbook for vision-language pretraining","venue":null,"work_id":"0c24ef2e-2a71-4a48-8d77-55f8efbc2e06","year":2025},"citing_paper":{"arxiv_id":"2605.09271","last_updated":"2026-05-10T02:42:29Z","snapshot_observed_at":"2026-08-12T15:02:13.436236Z","submitted_at":"2026-05-10T02:42:29Z","title":"Shaping Schema via Language Representation as the Next Frontier for LLM Intelligence Expanding","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-12T05:01:38.118237Z"},"links":{"cited_paper":"/paper/2501.00958","citing_paper":"/paper/2605.09271"},"observation_digest":"sha256:4cd57fcb243e5804aa461ef3115b89d2ca3401cf8132d744ac35b9ca3912d179","observation_id":"3509a9af-5078-47ba-9cd8-a82bdce4b7d4","resolution":{"observed_at":"2026-05-12T05:41:27.436177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.00958/citation-record","integrity":"/paper/2501.00958/integrity","json":"/paper/2501.00958/citation-record.json","paper":"/paper/2501.00958"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-10T22:41:33.415370Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.415370Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:e8dd97e6f6e8facfa96126d3c5642faaac3cf9ab25a2ac5592284c2c71bde3e1","observation_id":"19a81898-c503-4dc9-b66c-74b2259c93a4","resolution":{"observed_at":"2026-08-10T22:41:33.415370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-20T14:44:18.211453Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-10T22:41:33.420477Z","title":"Phi-4 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.420477Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:6fbfe642c07b887c0ced751d25d170cfef781b5cb21b93a4ec9d0812e81fa20c","observation_id":"5d468dde-5869-4eb3-bf8b-6d5243185b2a","resolution":{"observed_at":"2026-08-10T22:41:33.420477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T22:41:33.424920Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.424920Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:88d8eb75a21f21b6c4f74f79bae58a099c9cd7cdb227b21f25792f9f0b7be098","observation_id":"d1b21053-f891-4028-9c21-1c167550c89f","resolution":{"observed_at":"2026-08-10T22:41:33.424920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:33.429340Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.429340Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:00c12fe6c9f38c8c9d9ee71d6b7742387b493d2625a15fbeb795df141c5458c2","observation_id":"70e7d395-7f3f-44d5-b60a-900eb5e1c84b","resolution":{"observed_at":"2026-08-10T22:41:33.429340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-10T22:41:33.433950Z","title":"Openflamingo: An open- source framework for training large autoregressive vision- language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.433950Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:5ae2e14bd411fee766065680fc3abf6fdd4bcbcda8c36e8b95a1e4b8b08e970c","observation_id":"b4ba0d46-c611-4779-94ff-6deaecfd7e9f","resolution":{"observed_at":"2026-08-10T22:41:33.433950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11271","last_updated":"2024-10-31T03:29:34Z","snapshot_observed_at":"2026-08-16T13:42:25.017028Z","submitted_at":"2024-06-17T07:21:36Z","title":"MINT-1T: Scaling Open-Source Multimodal Data by 10x: A Multimodal Dataset with One Trillion Tokens","version":5},"cited_work":{"arxiv_id":"2406.11271","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.11271","snapshot_observed_at":"2026-08-10T22:41:34.057443Z","title":"MINT-1T: Scaling Open-Source Multimodal Data by 10x: A Multimodal Dataset with One Trillion Tokens","venue":"cs.CV","work_id":"b30400d9-3d33-40a5-9f2d-25cd03f929fc","year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.438886Z"},"links":{"cited_paper":"/paper/2406.11271","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:cde5960ab6de78aa9aa0a987f6c9e69348b513d678a24280d847399c5859e37c","observation_id":"6da73a83-1a9c-4f35-8ccd-c6d10f6daf40","resolution":{"observed_at":"2026-08-10T22:41:34.063728Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T22:41:33.444839Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.444839Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:570b9cc42d0789cd3d375e02182a2a31101555717f9363ec626e1c5e08fa95b5","observation_id":"d5cfa623-c584-4114-977b-0878e5c3958d","resolution":{"observed_at":"2026-08-10T22:41:33.444839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:34.420668Z","title":"Coyo-700m: Image-text pair dataset","venue":null,"work_id":"a9fea5e7-6b3d-4cec-8bbf-ae1fd2320b05","year":2022},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.449374Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:c2ccca2a34ce7989353954b99e22b6c5f9e230cb7e2151328bf5d7cce8e9d721","observation_id":"63a009ad-b5fc-4f62-b699-44e810313bc0","resolution":{"observed_at":"2026-08-10T22:41:34.424654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10462","last_updated":"2025-04-02T13:30:29Z","snapshot_observed_at":"2026-08-16T13:42:47.494667Z","submitted_at":"2024-06-15T01:27:58Z","title":"CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10462","snapshot_observed_at":"2026-08-10T22:41:33.453802Z","title":"Comm: A coherent inter- leaved image-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.453802Z"},"links":{"cited_paper":"/paper/2406.10462","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:672646d6078f72ac6ba9fbe5c6d0e9ebac66f9232d0e9a7bf852a0f54b797059","observation_id":"27405bc8-1e8b-4909-8ce9-6709ea4a9fa5","resolution":{"observed_at":"2026-08-10T22:41:33.453802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-10T22:41:33.458104Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.458104Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:c276f4a83c8a033d375c2dbee8664aa35ae4bf2a715721f6763e62d7869b787c","observation_id":"abc1fe38-9012-4cf2-a9ab-826fe649d5d7","resolution":{"observed_at":"2026-08-10T22:41:33.458104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-10T22:41:33.462287Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.462287Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:ed13550f0b3d603d4a2c6e2d3ac619818c4edf5bf56f813b800b5aee6d64b37d","observation_id":"305a66cc-66bb-4c0f-98c6-b63c226491ae","resolution":{"observed_at":"2026-08-10T22:41:33.462287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-10T22:41:33.466554Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.466554Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:e6e46e999b78f87ffc103bbad8cc31d3b3aaffeef04622602177a71f6c78033c","observation_id":"65f0a421-4009-4948-907f-b4dabf5d67c3","resolution":{"observed_at":"2026-08-10T22:41:33.466554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18558","last_updated":"2025-01-06T12:48:47Z","snapshot_observed_at":"2026-08-18T09:10:03.802508Z","submitted_at":"2024-10-24T09:03:48Z","title":"Infinity-MM: Scaling Multimodal Performance with Large-Scale and High-Quality Instruction Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18558","snapshot_observed_at":"2026-08-10T22:41:33.470574Z","title":"Infinity-mm: Scaling multimodal per- formance with large-scale and high-quality instruction data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.470574Z"},"links":{"cited_paper":"/paper/2410.18558","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:b50435762e63273f3a3a873ff73bbe3f8c3a67f40b4bd425a647047dd71196e2","observation_id":"7417e222-25cc-4ed3-a0a5-430725dcbf4c","resolution":{"observed_at":"2026-08-10T22:41:33.470574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-08-13T11:19:55.436754Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-10T22:41:33.474634Z","title":"Textbooks are all you need","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.474634Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:e6008b5399e2e8de38d41e8f3dace54157e65a9e56fa76c8c051ea6ef789d35b","observation_id":"cb38d3f1-76b2-4abc-9760-f168676a69de","resolution":{"observed_at":"2026-08-10T22:41:33.474634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-08-16T03:39:21.994462Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-10T22:41:33.478758Z","title":"Video-mmmu: Evaluating knowledge acquisition from multi-discipline pro- fessional videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.478758Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:68849b4b0b704e90aa6a9b251dd1b8c53f8d435f0bff335764a28c0fa8272da9","observation_id":"ea6ee0ee-fb3f-409d-b746-f4e57e05b61f","resolution":{"observed_at":"2026-08-10T22:41:33.478758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:34.408659Z","title":"Language is not all you need: Aligning perception with language mod- els","venue":null,"work_id":"2b3700ec-ba2d-4681-9a94-d630595d1ae4","year":2023},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.482505Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:d638957fe26b7c2a1e916898b1b3eff5ca13d52f5f3e00d2c4cf8a3ae452aee2","observation_id":"e84cd31b-bb6e-491f-acc8-75453cb690aa","resolution":{"observed_at":"2026-08-10T22:41:34.412410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:34.396867Z","title":"Phi-2: The surprising power of small language models","venue":null,"work_id":"5d035d8b-520e-42bb-999d-7e8cb5e77cf3","year":2023},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.486102Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:b2c0f119a3aeb0eb4dc5606b65c58e7b5c7873d71fd4995dd825ad6bfcac1add","observation_id":"3c082ae1-28ad-4531-9aaf-9217b1f59e70","resolution":{"observed_at":"2026-08-10T22:41:34.400963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:33.490244Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.490244Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:27083111f0ece25fe927457e3ab09fbeb1900db85d56594af437dbc6fb8b4d6c","observation_id":"796e83b5-d867-4a60-93dd-1c144f0fab90","resolution":{"observed_at":"2026-08-10T22:41:33.490244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-08-19T00:16:42.047230Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-10T22:41:33.494187Z","title":"Mantis: Interleaved multi-image instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.494187Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:742690bfcc54077f2ef9ecf7152227650c90b572fb73469340caf684cd89455c","observation_id":"1ef98b67-3213-4d26-8d38-47b74fb39781","resolution":{"observed_at":"2026-08-10T22:41:33.494187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12637","last_updated":"2024-08-22T17:47:24Z","snapshot_observed_at":"2026-08-21T13:23:07.012854Z","submitted_at":"2024-08-22T17:47:24Z","title":"Building and better understanding vision-language models: insights and future directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12637","snapshot_observed_at":"2026-08-10T22:41:33.498202Z","title":"Building and better understanding vision- language models: insights and future directions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.498202Z"},"links":{"cited_paper":"/paper/2408.12637","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:7487e6dabf94c44da555370a543dfc199fc0aa27aba3243f2401501b3bacdfb6","observation_id":"4662635b-f70f-440c-bc44-1957f06b8306","resolution":{"observed_at":"2026-08-10T22:41:33.498202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-16T13:55:33.670920Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-10T22:41:33.502091Z","title":"What matters when building vision-language models? arXiv preprint arXiv:2405.02246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.502091Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:26eca51c4ca5e211002631f0e869ced56fef485d2123bb3850ba4b2d11973d37","observation_id":"4f70afbb-80fb-401c-b613-9d37cd13c1db","resolution":{"observed_at":"2026-08-10T22:41:33.502091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:33.505809Z","title":"Rush, Douwe Kiela, Matthieu Cord, and Victor Sanh","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.505809Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:6fe61f5036eafa1b9e75b0b1f2d11ca20f5701d79967fccc7e7fa9be069fed22","observation_id":"0fe4f996-0c70-4d58-b9c0-8393bc5eaab2","resolution":{"observed_at":"2026-08-10T22:41:33.505809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:34.373040Z","title":"Unicoder-vl: A universal encoder for vision and language by cross-modal pre-training","venue":null,"work_id":"6a87f3ca-25d6-42be-ac0d-dfb50cd9b603","year":2020},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.510065Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:5ed0ab95087caa62513368602a370040514f89b2b906f748c2390e9d68170fe8","observation_id":"78360fe2-975a-4e0a-a6f7-72197a3a3d47","resolution":{"observed_at":"2026-08-10T22:41:34.376772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:33.514036Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.514036Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:0717f9ab343ec2895a3f4ff30902a52c690f543a77d44b926ba0cd4649de87c3","observation_id":"e6e3b362-b6b0-4b4d-99be-20510be8ac04","resolution":{"observed_at":"2026-08-10T22:41:33.514036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08418","last_updated":"2024-07-12T08:54:51Z","snapshot_observed_at":"2026-08-18T03:58:53.796357Z","submitted_at":"2024-06-12T17:01:04Z","title":"OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08418","snapshot_observed_at":"2026-08-10T22:41:33.517914Z","title":"Omnicorpus: An unified mul- timodal corpus of 10 billion-level images interleaved with text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.517914Z"},"links":{"cited_paper":"/paper/2406.08418","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:5e84002a648a0ddd43a14db0bebe03adbcb4c94dbce66c8463948b94b5f5d598","observation_id":"ac0ba78b-5f72-4496-89f4-a62cafe8728f","resolution":{"observed_at":"2026-08-10T22:41:33.517914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05463","last_updated":"2023-09-11T14:01:45Z","snapshot_observed_at":"2026-08-02T22:47:03.212781Z","submitted_at":"2023-09-11T14:01:45Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05463","snapshot_observed_at":"2026-08-10T22:41:33.522200Z","title":"Textbooks are all you need ii: phi-1.5 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.522200Z"},"links":{"cited_paper":"/paper/2309.05463","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:0ef6db0da947a5eb124f1917d4b3cf8f63b70e4928025bf42b4cfa5f807e043b","observation_id":"63661e11-afca-46a1-be82-c457fa8f58d7","resolution":{"observed_at":"2026-08-10T22:41:33.522200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03281","last_updated":"2023-08-07T03:52:59Z","snapshot_observed_at":"2026-08-14T21:56:20.223557Z","submitted_at":"2023-08-07T03:52:59Z","title":"Towards General Text Embeddings with Multi-stage Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03281","snapshot_observed_at":"2026-08-10T22:41:33.526669Z","title":"Towards general text embeddings with multi-stage contrastive learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.526669Z"},"links":{"cited_paper":"/paper/2308.03281","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:de2968acf0d6f8ef71c6bd28ca57abae6950a458f8e15dbe7b5a7a837be70336","observation_id":"1a1f334b-6289-441d-b46a-ea7f2305610f","resolution":{"observed_at":"2026-08-10T22:41:33.526669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:34.353365Z","title":"Vila: On pre-training for visual language models, 2023","venue":null,"work_id":"5e31b1ef-c189-4d7c-9ec4-6a8d75171fa3","year":2023},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.531559Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:6559cc1d020d5c2624365e7eb61c72f391afb88bb0910ac14edffe5a4f2bf49d","observation_id":"166456da-11b0-4c38-8319-91d3bab432f0","resolution":{"observed_at":"2026-08-10T22:41:34.357362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:33.535728Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.535728Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:e5db43dfa5c1d2c477629ac0432b046d6d0efff3725544fb009422f0236582ea","observation_id":"53517bd6-ca20-41c7-a2d1-d9d3fada8173","resolution":{"observed_at":"2026-08-10T22:41:33.535728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:33.540060Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.540060Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:4a3361cbcb27177c90c438698186fc63ca77182c79d835207a2433bb6df2f684","observation_id":"68b767fd-cd5b-4228-a018-fd99a2f01690","resolution":{"observed_at":"2026-08-10T22:41:33.540060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:34.327383Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"33d07910-4b88-4a3f-8b77-a959237daf14","year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.543877Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:277bbd0931d3eaa1abf0dea22b5d5a23e9db316e646d77a78031664062885c4e","observation_id":"da4c6b75-3f40-4f4a-8471-3b20b200386d","resolution":{"observed_at":"2026-08-10T22:41:34.332208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:33.547555Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.547555Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:fbafca88fdbf3aec75fbdf0ca76c944275adad6a33a29d6cadff861d25c85443","observation_id":"ae97e300-461c-405d-a3c3-14944bc3b69a","resolution":{"observed_at":"2026-08-10T22:41:33.547555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-19T16:22:29.898436Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-10T22:41:33.551296Z","title":"Deepseek-vl: towards real-world vision- language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.551296Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:8e53a308d682a385cce42dc2b99158331ad96f949c5ac830fb7edadf7c952644","observation_id":"d3b828b9-517c-4837-9239-0b8ee1b52986","resolution":{"observed_at":"2026-08-10T22:41:33.551296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:33.555750Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.555750Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:dd0661f80fe4844ebe83a9b747d5151f1375ad48fcf47a65beb62ed385099486","observation_id":"2c5fd610-f5d1-4690-bab9-f151740d2b5d","resolution":{"observed_at":"2026-08-10T22:41:33.555750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:33.559914Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.559914Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:853282d4c8d3a2d953d798f0ddd4cb56d2c0597d8cbbfdf241d233e696a5bae9","observation_id":"446e088e-95ca-4ec4-852f-adb4f460886f","resolution":{"observed_at":"2026-08-10T22:41:33.559914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-08-16T18:14:04.403890Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-10T22:41:33.563686Z","title":"Mm1: Methods, analysis & insights from multimodal llm pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.563686Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:950e5cdefdc2940d9b381ed60e62bf4b8aa4a790c0c75336c571d5098c2fd524","observation_id":"7ebac317-42ee-47c1-a01c-9d8aa13303b0","resolution":{"observed_at":"2026-08-10T22:41:33.563686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:34.293577Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"444d93df-7abe-4004-bb2d-78df8a574e42","year":2019},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.567799Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:b54eb3e0e9eb441064e366f264a09b4b2a4c1c283e5f84c8d7aad5f829325865","observation_id":"6f540502-10a1-44fb-802d-6ea3756ed07e","resolution":{"observed_at":"2026-08-10T22:41:34.297900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:34.281134Z","title":"True few- shot learning with language models","venue":null,"work_id":"1bd2acb1-69f2-4939-84e1-5317c4d8a73c","year":2021},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.571772Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:7c0ce0af8d87895f301dcdd94defa80e114d2bdae55e85ca74b02d5457a15908","observation_id":"b0f5f245-7ac8-4402-9e10-dad28df63f41","resolution":{"observed_at":"2026-08-10T22:41:34.285874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:33.577332Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.577332Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:2447a325d7a959994a4c7b989843e4ad9898fb177d3c7505441cef38c78a33e2","observation_id":"136864f4-bcbf-4e70-8305-93e908a04fe7","resolution":{"observed_at":"2026-08-10T22:41:33.577332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00347","last_updated":"2018-12-07T07:03:52Z","snapshot_observed_at":"2026-08-14T18:05:47.659963Z","submitted_at":"2018-11-01T12:47:11Z","title":"How2: A Large-scale Dataset for Multimodal Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00347","snapshot_observed_at":"2026-08-10T22:41:33.581898Z","title":"How2: a large-scale dataset for multimodal language under- standing","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.581898Z"},"links":{"cited_paper":"/paper/1811.00347","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:14bcb27705e3381fda99d5be427ebdb54ffcb73b27e477ffd2252e3b6b0059dc","observation_id":"7b8dd9a1-41b7-46e7-ac8d-34b2652dea38","resolution":{"observed_at":"2026-08-10T22:41:33.581898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-10T22:41:33.586566Z","title":"LAION- 400M: open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.586566Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:526a6f752071c8855b79fef3cc155500914d529b7eb09c68246c84f2d0826efb","observation_id":"e4f81f18-01e3-481b-8907-b962753dbe7b","resolution":{"observed_at":"2026-08-10T22:41:33.586566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:34.262942Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"44bdce17-d3d9-48fd-bef8-a5d2479ea766","year":2022},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.591393Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:eca7d2b48f02be05e594692f42525791e3c293b58b18e1f958f2319c39f87d01","observation_id":"03c399bb-ea41-46a5-8535-4ea5308be216","resolution":{"observed_at":"2026-08-10T22:41:34.266562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:33.594974Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.594974Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:6278f7b3b8117d3ee481e96f2da7a3feb3162e0cfbfa54806d32d8faac100b33","observation_id":"cfb94201-92a2-4bc9-b51b-4bb9643bf3c9","resolution":{"observed_at":"2026-08-10T22:41:33.594974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:34.243192Z","title":"Generative multimodal mod- els are in-context learners","venue":null,"work_id":"8ede0ac8-8faa-4097-b5b3-41faf8b1634b","year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.598821Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:a6eee1dd23093ef92544bfa748ba2ae733bb6391f0c46e806080692a6fee8313","observation_id":"7d7a3e7c-3e33-47ab-9117-8c6093582396","resolution":{"observed_at":"2026-08-10T22:41:34.246865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-10T22:41:33.603647Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.603647Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:3448a3c6ecc693b202febf835a342e7b5d9d7f374a81cf653a3d23181a74a5e3","observation_id":"a4bf3cd4-a804-47e7-8021-08b2e75e73b2","resolution":{"observed_at":"2026-08-10T22:41:33.603647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T22:41:33.608533Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.608533Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:ad7d3b4682632815c4ae74951d965759ab7a902e4c8f319ddbe7c8eeb73a0150","observation_id":"2862ef4c-f3d6-410f-9b37-35db36abbf42","resolution":{"observed_at":"2026-08-10T22:41:33.608533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:34.231214Z","title":"Mobile- clip: Fast image-text models through multi-modal reinforced training","venue":null,"work_id":"33b40490-3c14-4c22-97ee-530ad5a17bcf","year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.612968Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:2cc8952fdcf655b58df73d89c778437dcf936916bdca7b60b990c032062982a0","observation_id":"535b67e5-2d7b-49b8-ad45-1e3e1a625524","resolution":{"observed_at":"2026-08-10T22:41:34.236099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13923","last_updated":"2025-09-09T04:55:02Z","snapshot_observed_at":"2026-08-16T14:22:29.861493Z","submitted_at":"2024-06-20T01:43:08Z","title":"PIN: A Knowledge-Intensive Dataset for Paired and Interleaved Multimodal Documents","version":3},"cited_work":{"arxiv_id":"2406.13923","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.13923","snapshot_observed_at":"2026-08-10T22:41:33.809036Z","title":"PIN: A Knowledge-Intensive Dataset for Paired and Interleaved Multimodal Documents","venue":"cs.AI","work_id":"8186fbcb-a696-44f7-8bb4-656db43c4292","year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.616945Z"},"links":{"cited_paper":"/paper/2406.13923","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:be2752d17dff0eaf00fbbd5acc4a7e84c1674cbec5f018186d6425b6f940bd2d","observation_id":"01e51f8b-1e81-4081-893f-cc2d29d6c965","resolution":{"observed_at":"2026-08-10T22:41:33.815663Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-10T22:41:33.621736Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.621736Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:fbf061c7ddc7f72ff47056e8242ec58abfd3b086647eef0adde066f52c2264f0","observation_id":"81a89059-0ce5-4ce6-9ef3-025dadc1d6b9","resolution":{"observed_at":"2026-08-10T22:41:33.621736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:33.625319Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.625319Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:a499a985615714a18aa9611d500fe310f4192368df9f9103ca44423060877631","observation_id":"368c1881-c794-4ecb-a8f0-b373eb63b056","resolution":{"observed_at":"2026-08-10T22:41:33.625319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-10T22:41:33.628692Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.628692Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:c1cf5329e8db08b71e00f19827ef561a39291ceb20d5aa67b9c235b7bfc493a8","observation_id":"7ca87b8d-1d5c-48a3-93f7-d08752ffe494","resolution":{"observed_at":"2026-08-10T22:41:33.628692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:34.212495Z","title":"An empirical study of gpt-3 for few-shot knowledge-based vqa","venue":null,"work_id":"f9724793-0f78-460a-bb6d-4e485fcca4b1","year":2022},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.632037Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:a862d0d74faa70122ad8743e18c4c9cb5ced6649c952816d85ff71ab7d8e0952","observation_id":"5cf22d33-fa1a-4350-b76e-3cc94dd0751f","resolution":{"observed_at":"2026-08-10T22:41:34.216387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-08-21T07:48:51.700518Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T22:41:33.635688Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.635688Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:40bde6776d7be68fdd13ea3f884ee97653bbc391dd5ebdb3a3c3a75cad5537c8","observation_id":"0df0f12a-c6bb-45d4-98c9-88d37be09f77","resolution":{"observed_at":"2026-08-10T22:41:33.635688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-08-16T23:01:47.789827Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-10T22:41:33.639213Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.639213Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:5df4969d8a22b7e1d2df8bfd99263f0918eb641bf05453f77c378264d29fa72c","observation_id":"6081b138-d8ae-424a-b59a-646d4feaedbb","resolution":{"observed_at":"2026-08-10T22:41:33.639213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:34.201502Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"4f9092bc-bc05-41b4-b7ca-5296bb6dae13","year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.643096Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:d644e441bc5c6a06796ffc96cabe9d5653fb3061ec4d22acea905dcede2e8bd5","observation_id":"1004c520-fb61-44b1-afe2-bb02954dee39","resolution":{"observed_at":"2026-08-10T22:41:34.205725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:34.191150Z","title":"Merlot reserve: Neu- ral script knowledge through vision and language and sound","venue":null,"work_id":"cdd8837a-820f-436b-8b84-ddf63123fe97","year":2022},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.646884Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:6d887d7512164df4733aac6e70e7ac727691d4c2f47594c29737c3c26cfd0750","observation_id":"4e868f3e-21e9-4443-8232-f5746ad3b439","resolution":{"observed_at":"2026-08-10T22:41:34.195186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-10T22:41:33.650394Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.650394Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:bb84cc7317876e1c560115cc3b8b283f2c87f42e2c4b1cb37ee111e2ab7481e0","observation_id":"c8521ea9-ad14-473a-8b8a-b88338adf286","resolution":{"observed_at":"2026-08-10T22:41:33.650394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21696","last_updated":"2025-05-14T17:48:02Z","snapshot_observed_at":"2026-08-16T12:46:13.492295Z","submitted_at":"2025-03-27T17:00:51Z","title":"Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21696","snapshot_observed_at":"2026-08-10T22:41:33.654630Z","title":"Embodied-reasoner: Synergizing visual search, reasoning, and action for embodied interactive tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.654630Z"},"links":{"cited_paper":"/paper/2503.21696","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:c24e3565ba7fc8451a81db8f119cf86e14be8a42718e4ffaa433fe8459b4322a","observation_id":"456ffcc3-2a1e-40b8-8d45-15eeca180e0c","resolution":{"observed_at":"2026-08-10T22:41:33.654630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-10T22:41:33.658362Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.658362Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:a723b6ffeb07f4ebc4e69b30c35bc74701a48bed58e7f4876c9f4e54402d2904","observation_id":"f56c5425-d8ee-434c-a30c-f86198eea148","resolution":{"observed_at":"2026-08-10T22:41:33.658362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:34.179329Z","title":"Multimodal c4: An open, billion-scale corpus of images interleaved with text","venue":null,"work_id":"b8d30e30-94df-4e35-891c-350db72a3bb2","year":2024},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.661842Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:c99082cf64f0c2e4386c077215200de67595e7b66960eaa1f3406a7abf9d0d59","observation_id":"6aafec04-ee17-439a-be23-2f4777742297","resolution":{"observed_at":"2026-08-10T22:41:34.183742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:34.166643Z","title":"Implementation Details When synthesizing the Knowledge Taxonomy, we utilize GPT-4o to construct the taxonomy","venue":null,"work_id":"47f4c857-ad3e-4221-ab6d-44bbbe4fdd25","year":null},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.665444Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:f76eb3a20574ff0d8b0b36a7be64d0f4a542e76f82bf28e73c6f970cddba7f1f","observation_id":"34633937-b0ca-4b6d-98f8-076e42a0e327","resolution":{"observed_at":"2026-08-10T22:41:34.170531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:34.154000Z","title":null,"venue":null,"work_id":"2a17657e-5e5b-4db1-a95f-df54fa8c0b45","year":null},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.670801Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:e1418d3057a726b4ccadf00c335f2d924e988e0ac222bb0b2f7925a5f3759fa9","observation_id":"c2c8b565-e288-43bc-b52a-676f0f40eb11","resolution":{"observed_at":"2026-08-10T22:41:34.157996Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:34.142025Z","title":"We will continue to improve the quality and knowledge density of our textbook","venue":null,"work_id":"aae5c0d7-d9b2-412a-a11c-68f2c59640ca","year":null},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.674940Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:5a16ba914d6d846105e4dbc537fa1d93808571fe8405a1e85074ccdb9cab7bb9","observation_id":"65ef5647-1766-4148-ae45-097d828e9668","resolution":{"observed_at":"2026-08-10T22:41:34.146027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:34.130550Z","title":null,"venue":null,"work_id":"ce89e66a-6d14-4585-b447-1468d883fd80","year":null},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.679491Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:5de20c6a0176537a4a299d67efa9c96fa64757a935df0e8ae6b272d3d4c3b90c","observation_id":"bf2a67c5-9339-456f-881b-0d87115b81c5","resolution":{"observed_at":"2026-08-10T22:41:34.134239Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:34.118377Z","title":null,"venue":null,"work_id":"cf283fbf-7534-49ed-85bd-e172e33d5144","year":null},"citing_paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T22:41:33.683491Z"},"links":{"citing_paper":"/paper/2501.00958"},"observation_digest":"sha256:c7e46d1df1f0885f91da6615cb42eda74a748d86e3a3ccc8e5520b29b0a3b423","observation_id":"735ffa26-4f41-48f0-845d-2f5b7dd4669c","resolution":{"observed_at":"2026-08-10T22:41:34.122765Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.00958","last_updated":"2025-05-13T16:29:08Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T17:14:28.671540Z","submitted_at":"2025-01-01T21:29:37Z","title":"2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":2,"verified_fuzzy":17},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 3 inbound Pith citation observations for arXiv:2501.00958."}