{"as_of":"2026-08-08T20:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0fe252b04708a81b1adfb7430ef82285438881429b9878ad96f1f4054f26be60","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:33:10.074420Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09657/citation-record","integrity":"/paper/2607.09657/integrity","json":"/paper/2607.09657/citation-record.json","paper":"/paper/2607.09657"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:06.490269Z","title":"Barsalou","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:06.490269Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:473307da45d069afc8b1e838cc65c0aca26cd1c583eec83e4abbbf0c249df203","observation_id":"b8c47e2c-77be-4d64-b8dc-b0f48c0f6e77","resolution":{"observed_at":"2026-08-02T07:33:06.490269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:06.544312Z","title":"Barsalou","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:06.544312Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:ba4614181fef547a79d233eb40e2ff09ffb9458e24abc2a954488cb80631a13d","observation_id":"3746aa4f-4b1a-474a-abf2-7f00e4336f24","resolution":{"observed_at":"2026-08-02T07:33:06.544312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:06.602015Z","title":"Nougat: Neural optical understanding for academic documents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:06.602015Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:e0e868d854e9f1424cc431910975d20caf4fc60d5df3b0c977dc27c874173e0e","observation_id":"9c2199ab-4db8-41f2-8e18-b8c88d96c95b","resolution":{"observed_at":"2026-08-02T07:33:06.602015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:06.685559Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:06.685559Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:a1774178e0f5dbea0b3890c76cb191ac80f63d09fc33682ef9848532ca5cc859","observation_id":"04c59f22-7e65-4f8b-ae08-07301156695f","resolution":{"observed_at":"2026-08-02T07:33:06.685559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:06.745182Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:06.745182Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:cf0b3c459d73e96ced5d688022d8c0f0e94b421f872ec90444bab4cec39db1c2","observation_id":"fa8e1007-5b7a-4170-9e61-754bd09c3719","resolution":{"observed_at":"2026-08-02T07:33:06.745182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:06.850051Z","title":"Xtuner: A toolkit for efficiently fine-tuning llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:06.850051Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:b89221f36aa23ee595b7f416b9f3e2e4c1af339bd9c05a4209a4f8002b7f45bc","observation_id":"d5966839-b7c8-46d8-a512-df69ed8f9a29","resolution":{"observed_at":"2026-08-02T07:33:06.850051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-02T07:33:06.907550Z","title":"The pile: An 800gb dataset of diverse text for language modeling.arXiv preprint arXiv:2101.00027, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:06.907550Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:82095c50c3efd0f9d389a68cdb9f317917c269ade2625a8b31ac7fcc337bebe9","observation_id":"d05adbf0-518e-42c0-81ae-2888d6666cde","resolution":{"observed_at":"2026-08-02T07:33:06.907550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-02T07:33:06.985962Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:06.985962Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:4e8df8b67942579f9ed0e3e470a505c501f12d9f64ae920baa6a8e5958157a00","observation_id":"fbbca701-a1c5-4493-905c-b37dbac3e40a","resolution":{"observed_at":"2026-08-02T07:33:06.985962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-02T07:33:07.074419Z","title":"Training compute-optimal large language models.arXiv preprint arXiv:2203.15556, 10, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:07.074419Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:92fb388f062763187298fc2a290b043682a360e2cd8da0ab6310507b5ac66a4b","observation_id":"bb00c18b-c33b-433e-8f8d-c9c7974b8c75","resolution":{"observed_at":"2026-08-02T07:33:07.074419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07987","last_updated":"2024-07-25T09:33:50Z","snapshot_observed_at":"2026-08-06T11:02:06.607024Z","submitted_at":"2024-05-13T17:58:30Z","title":"The Platonic Representation Hypothesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07987","snapshot_observed_at":"2026-08-02T07:33:07.150324Z","title":"The platonic representation hypothesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:07.150324Z"},"links":{"cited_paper":"/paper/2405.07987","citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:ab9f9289e6afc0cf3dcd5b1f81c3cda52efbd63f19f16b7bf30aa668d805a4b3","observation_id":"ec3917de-ad44-4442-b341-57b7e1b0b96c","resolution":{"observed_at":"2026-08-02T07:33:07.150324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-02T07:33:07.236494Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:07.236494Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:d583dddcaa13ee2525d438cb8ea3efd183ea251af2b0bc0e15a870ca8389b9da","observation_id":"0b2623e6-b67b-4d20-b6b4-44af10497db0","resolution":{"observed_at":"2026-08-02T07:33:07.236494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-02T07:33:07.392869Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:07.392869Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:c28725cdfd567181511f89f3ee52fa23e806a137f2ed143accc32b99b6b9f9cb","observation_id":"00c2fbd2-7cea-4e09-8dff-7d2e5eb89b4e","resolution":{"observed_at":"2026-08-02T07:33:07.392869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.15664","last_updated":"2022-10-06T06:50:39Z","snapshot_observed_at":"2026-08-06T10:03:36.325862Z","submitted_at":"2021-11-30T18:55:19Z","title":"OCR-free Document Understanding Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.15664","snapshot_observed_at":"2026-08-02T07:33:07.528113Z","title":"Donut: Document understanding transformer without ocr","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:07.528113Z"},"links":{"cited_paper":"/paper/2111.15664","citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:93d3f8b705c5b900aba8e2ee320f814c40a955d012f880c14e701f12a0fcaad9","observation_id":"751d240c-522c-4644-90d7-b6a264841737","resolution":{"observed_at":"2026-08-02T07:33:07.528113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:07.644161Z","title":"Similarity of neural network representations revisited","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:07.644161Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:8b8cde6cefc6c3fd65c19ef0ea3d337f31dbfef6ca6b98a557845c1029ef1750","observation_id":"1c9a8ba3-9ca8-4360-8ed4-6ceb840a36fe","resolution":{"observed_at":"2026-08-02T07:33:07.644161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/s0364-0213(87)80026-5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Larkin and Herbert A","venue":"Cognitive Science","work_id":"37e5b693-1aee-49f6-8073-1552c47c4961","year":1987},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:07.776300Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:5160b8fb09f5d3a4e347d0a30770d2753755775eccb78d2c1cf67ced79f45557","observation_id":"08469284-d937-4473-9dda-95329c39aa22","resolution":{"observed_at":"2026-08-02T07:33:23.871972Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:07.883796Z","title":"Pix2struct: Screenshot parsing as pretraining for visual language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:07.883796Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:03522d5b89b1cfea07175ea22324e4e9e2d7314e066d73cc9494e785fb6505b5","observation_id":"72ab5ab9-1b4b-4ff8-befb-867806a997c8","resolution":{"observed_at":"2026-08-02T07:33:07.883796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:08.010422Z","title":"Tracing the representation geometry of language models from pretraining to post-training","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:08.010422Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:ce15ae62b2ffc80983fc3b60e5bb7bc83895b5a439509d7f947f7065f242115e","observation_id":"5b609578-0400-4419-8d6b-6562de2c61bd","resolution":{"observed_at":"2026-08-02T07:33:08.010422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:08.103304Z","title":"Autoregressive image generation without vector quantization.Advances in Neural Information Processing Systems, 37:56424–56445, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:08.103304Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:a96fa6f690b1539e571814de95a0ea378c921151c4f910b4e9948610f647ba3a","observation_id":"4bfb3a5c-b2ca-4374-b82c-bdd75fd2e77e","resolution":{"observed_at":"2026-08-02T07:33:08.103304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:08.234774Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning.Advances in Neural Information Processing Systems, 35:17612–17625, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:08.234774Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:00a0c6fc8bcd132c6b1c679214898d81df96bc061cca338e72f8dc7b7b635e01","observation_id":"bbf0a4c9-2906-49ab-a274-d87212619035","resolution":{"observed_at":"2026-08-02T07:33:08.234774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01879","last_updated":"2024-05-15T07:15:05Z","snapshot_observed_at":"2026-07-06T15:37:23.958419Z","submitted_at":"2023-06-02T19:19:43Z","title":"Revisiting the Role of Language Priors in Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01879","snapshot_observed_at":"2026-08-02T07:33:08.314581Z","title":"Revisiting the role of language priors in vision-language models.arXiv preprint arXiv:2306.01879, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:08.314581Z"},"links":{"cited_paper":"/paper/2306.01879","citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:8a365a607029bf665a5189e59d6fc6e2c95a8e3d1a061ecb3dfec4da73dc4272","observation_id":"d20ccc5c-43f6-487e-aaf1-5b1d8fa8e22a","resolution":{"observed_at":"2026-08-02T07:33:08.314581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:08.385464Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:08.385464Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:e955c5c9f6243e16bfda422d1d199a054b84d9a3875cb0906c43b2563803e94c","observation_id":"93e5c59c-1d2a-4363-b0e4-424e34ef33c2","resolution":{"observed_at":"2026-08-02T07:33:08.385464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:08.453870Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:08.453870Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:80c5d53382f7a66fe3b5868789e8c131818f7a07d11d1742633823cafe86bbfa","observation_id":"dd40361d-36a6-42ff-ba76-8ddf1d893acd","resolution":{"observed_at":"2026-08-02T07:33:08.453870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:08.523079Z","title":"Chartqapro: A more diverse and challenging benchmark for chart question answering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:08.523079Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:3d304b37f47db277d987cadf4ac47665c8e1ea3c49ce7ce30e56ccd373868a51","observation_id":"239b6565-1ea2-4913-a2c7-827c8bd51436","resolution":{"observed_at":"2026-08-02T07:33:08.523079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:08.596163Z","title":"American invitational mathematics ex- amination (AIME)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:08.596163Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:75ef923a24b722dfa86c89ac725243dad0e1db448723467c0989a3c7caf3488e","observation_id":"8837db91-f031-4cc2-9926-e590a0b4b903","resolution":{"observed_at":"2026-08-02T07:33:08.596163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:08.637958Z","title":"Llama 3.2 vision model card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:08.637958Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:a376bac991d34cee4bdae2eb881d41b21dcdb64a3f9c0c1233f275733ebe6c7e","observation_id":"7472badf-d638-430c-bf9a-0602dd78126a","resolution":{"observed_at":"2026-08-02T07:33:08.637958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-02T07:33:08.702670Z","title":"Representation learning with contrastive predictive coding.arXiv preprint arXiv:1807.03748, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:08.702670Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:45334f9d36defee5a2d4cc325925cc223f278e12e405d5f9ed187e0df7edd09f","observation_id":"cb0efa8c-57e8-4dc6-9cf1-61721a724063","resolution":{"observed_at":"2026-08-02T07:33:08.702670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:08.774587Z","title":"Openwebmath: An open dataset of high-quality mathematical web text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:08.774587Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:d593b9dbc03cb048d79b3034932c5d53b2663e375ba9c9d050ca074124d185e0","observation_id":"acd58fce-6dc3-4b1a-8458-2ecbf37bc76a","resolution":{"observed_at":"2026-08-02T07:33:08.774587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-02T07:33:08.811875Z","title":"Humanity’s last exam.arXiv preprint arXiv:2501.14249,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:08.811875Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:fa6f842226e360b1090603033576c149461676457c5ce8df32aa4b7d40496b76","observation_id":"da07e400-09b4-4cf0-9132-7ad6451806a8","resolution":{"observed_at":"2026-08-02T07:33:08.811875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:08.893385Z","title":"Qwen3.5: Towards native multimodal agents, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:08.893385Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:98bc7f448341f104d3583008362baa7bcb3f5bfe05fdf4acfa88b492e8e8030b","observation_id":"5c16946c-be79-4299-b664-df7adfa67325","resolution":{"observed_at":"2026-08-02T07:33:08.893385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-02T07:33:09.024749Z","title":"Gpqa: A graduate-level google-proof q&a benchmark.arXiv preprint arXiv:2311.12022, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:09.024749Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:9fa92e5866abe85df0d67130f0b8f728e8f3cf530cf7b2700e83c584713a763b","observation_id":"6f8b033b-b4a0-4d54-9a0a-e204f9bee17e","resolution":{"observed_at":"2026-08-02T07:33:09.024749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:09.101168Z","title":"Visualizing data using t-sne.Journal of Machine Learning Research, 9(86):2579–2605, 2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:09.101168Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:ac065cd9bb85ba4eb5d23501162c4425cb3625fe9af4676b258c23bde654a46f","observation_id":"6a7e673d-0243-4486-9c16-46960ab59d5f","resolution":{"observed_at":"2026-08-02T07:33:09.101168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18839","last_updated":"2024-09-27T15:35:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T15:35:15Z","title":"MinerU: An Open-Source Solution for Precise Document Content Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18839","snapshot_observed_at":"2026-08-02T07:33:09.188408Z","title":"Mineru: An open-source solution for precise document content extraction.arXiv preprint arXiv:2409.18839, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:09.188408Z"},"links":{"cited_paper":"/paper/2409.18839","citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:b4d26b84b2c73a15d984133d314d969ebddd167f334eb7e778bd88fc974abadc","observation_id":"74266ce5-cc88-4c3b-9053-9d07f60f0c60","resolution":{"observed_at":"2026-08-02T07:33:09.188408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-02T07:33:09.307569Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:09.307569Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:105d04fa4f7512fe5459566db9e42c0ab905345998d09dbabf7325638eb86164","observation_id":"3b8ce6b2-4b6d-4290-ac23-c2a828bea112","resolution":{"observed_at":"2026-08-02T07:33:09.307569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-02T07:33:09.384419Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark.arXiv preprint arXiv:2406.01574, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:09.384419Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:1132ede2e8ac75a21a46586e979bc75209e2d939ce968d89ec3cda3074354f42","observation_id":"df685192-34af-4b8d-93d7-0f36f1a83b8b","resolution":{"observed_at":"2026-08-02T07:33:09.384419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-02T07:33:09.504568Z","title":"Emergent abilities of large language models.arXiv preprint arXiv:2206.07682, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:09.504568Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:7f77786a1c439cdc480867b5d879d6d04c1b8f697189c1df4833b6737b55c8c7","observation_id":"974d4fbd-1a77-4fbc-a192-c2a0eb3e8b59","resolution":{"observed_at":"2026-08-02T07:33:09.504568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T07:33:09.604908Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:09.604908Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:f467b53ae85b351918957e7730f511e34bf83fb5374c26d4e240defb38c3802f","observation_id":"0358d240-7186-4ea6-ba37-285247f7d261","resolution":{"observed_at":"2026-08-02T07:33:09.604908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:09.711862Z","title":"Mmmu-pro: A more robust multi-discipline multimodal understanding benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:09.711862Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:2bcfdae12fabf176937742a91d886cff8934e8e527b382b7c33dc37b109a2d9c","observation_id":"7a2b2e41-0edb-4191-83bd-a03c47bdd84d","resolution":{"observed_at":"2026-08-02T07:33:09.711862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:09.814260Z","title":"The nature of external representations in problem solving.Cognitive Science, 21(2):179–217,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:09.814260Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:f0f419e50c506fd714db2d5d429544c243e862f78d58715e75f7d60fcb54c6b8","observation_id":"53efcfad-baeb-412a-851a-d82299eafd8c","resolution":{"observed_at":"2026-08-02T07:33:09.814260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:09.994755Z","title":"Exploring visual pretraining for learning language intelligence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:09.994755Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:05af2be64dbeb1356fb99d42763928f94c148037ad8fac110deb4b85a42ed6e7","observation_id":"52eacf1a-c44b-48c2-bf79-fb92ac28f055","resolution":{"observed_at":"2026-08-02T07:33:09.994755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:33:10.074420Z","title":"think step by step","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:10.074420Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:0830a41a05c90d177da47be20d04fa0d5579a914dabcc15bf89a6e493f95f3d7","observation_id":"4d07708f-6447-41c0-940f-99d947910f73","resolution":{"observed_at":"2026-08-02T07:33:10.074420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1207/s15516709cog2102_3","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Cognitive Science","work_id":"aee3761a-6499-4a7f-b60c-fe407f04ea41","year":null},"citing_paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence","version":2},"reference_index":1997,"source":"pdf_text","source_observed_at":"2026-08-02T07:33:09.922162Z"},"links":{"citing_paper":"/paper/2607.09657"},"observation_digest":"sha256:9302d09c079396f1652558279d46f00d1137a74701d0abe43d06fa3ba388f647","observation_id":"ab1a5b1b-8b8e-4671-b708-ee06ebd0958b","resolution":{"observed_at":"2026-08-02T07:33:23.573861Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.09657","last_updated":"2026-07-20T10:08:28Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T07:09:04.035299Z","submitted_at":"2026-07-10T17:57:03Z","title":"Scalable Visual Pretraining for Language Intelligence"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2607.09657."}