{"as_of":"2026-08-07T08:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be1c737929ebdbec62d5013d64293e8723d1249ab7ea97b2a92869c003fa0268","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T06:05:51.822157Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:55:28.165189Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T11:55:28.599019Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"cited_work":{"arxiv_id":"2607.22043","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.22043","snapshot_observed_at":"2026-08-06T11:55:28.599019Z","title":"Scaling Native Multimodal Pre-Training From Scratch","venue":"cs.CL","work_id":"c45bc376-7111-4477-b135-5e362f469216","year":2026},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-07T06:40:48.431430Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":1},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-08-06T11:55:28.165189Z"},"links":{"cited_paper":"/paper/2607.22043","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:e0dca64c5c130fdb09c3f61b7592d7e9a6a42273bb3c2678eb0b7eec143ecc4a","observation_id":"41f0d0e1-821b-4096-8db3-3eb8253c53e9","resolution":{"observed_at":"2026-08-06T11:55:28.602138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.22043/citation-record","integrity":"/paper/2607.22043/integrity","json":"/paper/2607.22043/citation-record.json","paper":"/paper/2607.22043"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:05:51.822157Z","title":"B Experiment Results This section details the comprehensive per-benchmark results supporting the analyses presented in Section 4, organized into three primary categories","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:51.822157Z"},"links":{"citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:3c291b2c9a846efd1c374795154993153ebfd951c1a16d99dbd88d740a21b5e3","observation_id":"856c3335-7f7d-4384-b7a3-a456a6083ad4","resolution":{"observed_at":"2026-08-01T06:05:51.822157Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14739","last_updated":"2025-03-28T15:21:44Z","snapshot_observed_at":"2026-07-29T21:41:16.650188Z","submitted_at":"2025-02-20T17:05:58Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14739","snapshot_observed_at":"2026-08-01T06:05:50.162416Z","title":"SuperGPQA: Scaling LLM Evaluation Across 285 Graduate Disciplines.arXiv preprint arXiv:2502.14739,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.162416Z"},"links":{"cited_paper":"/paper/2502.14739","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:735f48d7b1d4dfdcdccd4f90a2868afb34ede1147b149889f2eef5a427bfa6db","observation_id":"ead061e3-8709-4d91-b02a-fdde4282e2bf","resolution":{"observed_at":"2026-08-01T06:05:50.162416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-02T11:13:42.401488Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-01T06:05:50.526418Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension.arXiv preprint arXiv:1705.03551,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.526418Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:32db40290d7b2a12e3c65b5dc5f1e960b92c7531cc9e00b85791eedb4ce7205e","observation_id":"e85c9bb8-a03c-4297-808f-ef5efe7d45ef","resolution":{"observed_at":"2026-08-01T06:05:50.526418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-08-01T06:05:50.965502Z","title":"SocialiQA: Commonsense Reasoning about Social Interactions.arXiv preprint arXiv:1904.09728,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.965502Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:c7264370cdbe08bd765d3c1559bcf60bbdbe915c658419196923383a2ac89bc5","observation_id":"bbd9c77e-1b29-4b8a-90f5-239837ed3207","resolution":{"observed_at":"2026-08-01T06:05:50.965502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06585","last_updated":"2025-09-09T04:46:37Z","snapshot_observed_at":"2026-08-05T23:02:46.819592Z","submitted_at":"2025-08-08T04:23:04Z","title":"CountQA: How Well Do MLLMs Count in the Wild?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06585","snapshot_observed_at":"2026-08-01T06:05:51.176081Z","title":"CountQA: How Well Do MLLMs Count in the Wild?arXiv preprint arXiv:2508.06585,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:51.176081Z"},"links":{"cited_paper":"/paper/2508.06585","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:41b8778a59203a68311a4c95b2ca2c91cd1c3b4bc9e23048d240f6c4545c81db","observation_id":"84f1ed92-845b-42d2-b20c-d7589845fe0d","resolution":{"observed_at":"2026-08-01T06:05:51.176081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:05:51.300505Z","title":"Beyond Language Modeling: An Exploration of Multimodal Pretraining","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:51.300505Z"},"links":{"citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:12efcfc73726b003ac0ea9bd9a75e982997fba4660e6cea826077922e5dd5d56","observation_id":"614566c2-0175-4d9a-aa16-8704f6bdfed6","resolution":{"observed_at":"2026-08-01T06:05:51.300505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-01T06:05:51.388385Z","title":"SigLIP 2: Multilingual Vision- Language Encoders with Improved Semantic Understanding, Localization, and Dense Features.arXiv preprint arXiv:2502.14786,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:51.388385Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:d06a37a80c81cb3e874f7f64c9bf176a241b8ed31c2e5893e1506935f58835d2","observation_id":"be91083e-1d09-4308-a721-39023b8eb3ee","resolution":{"observed_at":"2026-08-01T06:05:51.388385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-01T06:05:51.483271Z","title":"Logicvista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts.arXiv preprint arXiv:2407.04973,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:51.483271Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:f02d731232d73b7df4dadeb07bc09aa066afb4667f3cf6999ca0af9654ea515a","observation_id":"37482601-c0a9-4281-8423-757addebef24","resolution":{"observed_at":"2026-08-01T06:05:51.483271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-01T06:05:51.578252Z","title":"Hellaswag: Can A Machine Really Finish Your Sentence?arXiv preprint arXiv:1905.07830,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:51.578252Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:d8b46fd0a1977d107ed9ce351408be7d14d9bf1a5e538cc0fda54c14ba17a17b","observation_id":"0cbdd42e-40b8-47ee-b422-847ec4b20f7f","resolution":{"observed_at":"2026-08-01T06:05:51.578252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-01T06:05:51.646144Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models.arXiv preprint arXiv:2304.06364,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:51.646144Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:9fc224ef5775cc5713d0c9c3460b755c3c5892d9ddbae534d77755110668ae21","observation_id":"0299e798-3028-48b6-9547-ec7c6453b70c","resolution":{"observed_at":"2026-08-01T06:05:51.646144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-01T06:05:50.744535Z","title":"Kimi K2.5: Visual Agentic Intelligence.arXiv preprint arXiv:2602.02276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.744535Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:1ac3f30bafe9e89e17a297b60f0fd2c6065757f400d43f767b332220a6707039","observation_id":"4e62a012-efbd-40a0-969e-fc653e72f039","resolution":{"observed_at":"2026-08-01T06:05:50.744535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-01T06:05:50.633139Z","title":"Scaling Laws for Neural Language Models.arXiv preprint arXiv:2001.08361,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.633139Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:c56628855d0b89e5ca98ef0af4e20ca0188a0fb3c43e718a1c60aed4c1f2103f","observation_id":"6c65647e-5163-42cb-9a4d-fc7daf5f8f56","resolution":{"observed_at":"2026-08-01T06:05:50.633139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-01T06:05:51.077650Z","title":"Challenging Big-Bench Tasks and Whether Chain-of- Thought Can Solve Them.arXiv preprint arXiv:2210.09261,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:51.077650Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:7754c72cc4643490cd2e561f2e1eb1ad375aa528e263d34dee5225c69e538811","observation_id":"c06469c9-7efd-4bf6-bd39-c9338a0f66c5","resolution":{"observed_at":"2026-08-01T06:05:51.077650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-01T06:05:50.323293Z","title":"Training Compute-Optimal Large Language Models.arXiv preprint arXiv:2203.15556,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.323293Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:130a2c4a1a4b0ae48d74fec36fc655bbc4cfe2eb56e81814b2d0f981e92469fb","observation_id":"eca071a0-9487-4488-8b9e-a93547fca486","resolution":{"observed_at":"2026-08-01T06:05:50.323293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-07-31T17:39:49.561332Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-01T06:05:50.098846Z","title":"Emu3.5: Native Multimodal Models are World Learners.arXiv preprint arXiv:2510.26583,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.098846Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:a6377f7e90f62c69b0b437bb9ef32d430e5f0bfba8aaf9c93a2fe17e4462629e","observation_id":"72283a80-6ac1-414d-989d-5a71c8d3f60f","resolution":{"observed_at":"2026-08-01T06:05:50.098846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:05:50.428860Z","title":"OmniS- patial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models.arXiv preprint arXiv:2506.03135,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.428860Z"},"links":{"citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:0e90eedc1bebdeaa80cb822e3f5876f44800b696df2628377db688b06d83c515","observation_id":"0024aedb-602f-46ae-9c12-c734a14323da","resolution":{"observed_at":"2026-08-01T06:05:50.428860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-01T06:05:50.263534Z","title":"Measuring Massive Multitask Language Understanding.arXiv preprint arXiv:2009.03300,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.263534Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:365d396957bc450c1a8f25c2656d0eef39fd0efba3b699dbb5b81dd9c1ab611d","observation_id":"4d8c3356-65c3-4221-bd68-e3cb80d0dd06","resolution":{"observed_at":"2026-08-01T06:05:50.263534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-01T06:05:50.023614Z","title":"Training Verifiers to Solve Math Word Problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.023614Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:b3cd6c17edd10dee8c650e11834bea33c02aee02934e0bc6366e5fa24d7e5640","observation_id":"9cd0fced-9622-4c04-9a67-8736f94141b9","resolution":{"observed_at":"2026-08-01T06:05:50.023614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-01T06:05:50.854597Z","title":"DeepSeek-V3 Technical Report.arXiv preprint arXiv:2412.19437, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.854597Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:52556480075b09ee5b14d1fb2ef54ccc3c822378273232c73fb7a5372e0a2966","observation_id":"f40d8a51-4782-428a-9029-7ee9b258ee8e","resolution":{"observed_at":"2026-08-01T06:05:50.854597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:05:51.724178Z","title":"We detail the specific architecture configurations and training settings in Table","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":4096,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:51.724178Z"},"links":{"citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:075aabc50dfcbcaa37e2eadf8c257040bb118b2544eb3124386a211557af64e4","observation_id":"d57737de-fe33-415e-896e-4766186d75d6","resolution":{"observed_at":"2026-08-01T06:05:51.724178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-03T13:49:07.135078Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 1 inbound Pith citation observation for arXiv:2607.22043."}