{"as_of":"2026-08-06T11:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1276fd97fa65666719ebb15e1e56b5b2eee0e7f1765aa142e16a35369d96e0af","coverage":[{"denominator":137,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T01:55:12.501409Z","state":"measured"},{"denominator":180,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":180,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":80,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:54:26.182917Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":8,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T23:53:29.862702Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2410.07073"},"observation_digest":"sha256:e9c8e3ba963577b9dd9e621915276cdb305ba4d530b07d7d9a5ad45d5b9f2da2","observation_id":"8af8519b-85eb-4d2b-a7eb-050fdd0a6cad","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2411.15115","last_updated":"2026-04-20T17:59:36Z","snapshot_observed_at":"2026-08-02T10:06:23.710148Z","submitted_at":"2024-11-22T18:31:47Z","title":"Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T08:25:01.468957Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2411.15115"},"observation_digest":"sha256:f6c14f90786594936c94ddbccf6d8acf7914769abfa45cd67df7528b0a0b9fe5","observation_id":"20e8761d-11f8-4f0f-8008-9f08393c93ac","resolution":{"observed_at":"2026-05-23T08:25:29.404962Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T09:15:07.523565Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2412.03555"},"observation_digest":"sha256:095dc7b182587086dbf6deaaaf957172d37e7a82f5192290e9408e7dd4d9f497","observation_id":"ba0311bd-3799-4d48-89c7-1eed439d2f76","resolution":{"observed_at":"2026-05-15T09:15:07.659639Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2412.04454","last_updated":"2025-05-05T16:17:20Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T18:58:26Z","title":"Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-18T04:09:41.494136Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2412.04454"},"observation_digest":"sha256:9cd55982a67c924248cb6252ded3f0c2fbcffe2c72c05ece1e0efbda68ab404a","observation_id":"30682552-5cf8-4c71-98dd-c76d6aa030b7","resolution":{"observed_at":"2026-05-18T04:09:41.566717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:cdc7ace860545556699dccae6c606f0ae7485c95b2ad90a65b649efcbccd1308","observation_id":"b688c074-fbc0-45fe-a1fa-7b85d8d9a822","resolution":{"observed_at":"2026-05-23T07:42:43.122814Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:78054161c4d92509602474b8d9d5472a6a96fa14b49b2d67b001a5533efbd493","observation_id":"7286b563-8a32-4138-aa2c-422486401088","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T10:09:21.542356Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2412.10302"},"observation_digest":"sha256:bb3ae2681dd682d74041757dc02f87f587512c1d91d2646a02629e841f8f0edf","observation_id":"c81f48ad-3d61-48e7-944c-fa3a6ae5ab3e","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:9943ae009a8a1b301bdf4dfffc99891a24e621051e452de7d5e794ef5c2ee82c","observation_id":"e70fe4f2-ee1e-4a49-ba6e-5e76eff24780","resolution":{"observed_at":"2026-05-17T20:33:26.807978Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:89c224de4a7244e47ae6279a9688131dd0cd6b9f4aeb23ef2b430fa0c21e9773","observation_id":"b1eea010-638d-4c12-84de-b93cf2eb9da3","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:881835d7b3f45c0afaf6f2d4baa52883144e5e3de18b9d2b8ea242829f3029a2","observation_id":"951b5426-f4ed-4f0a-983e-cc0efc7b2ecd","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2503.02597","last_updated":"2026-05-15T01:15:57Z","snapshot_observed_at":"2026-08-03T04:26:47.170682Z","submitted_at":"2025-03-04T13:18:33Z","title":"Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T01:23:01.892612Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2503.02597"},"observation_digest":"sha256:308119bd6912835e1eb0697f7661c206bf6c9717d0a2376cea37af700298c6d4","observation_id":"2f8a1c20-5fed-4c20-bdc4-7856133ce447","resolution":{"observed_at":"2026-05-23T01:25:16.462613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2503.05066","last_updated":"2026-05-11T07:44:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T01:11:39Z","title":"Capacity-Aware Inference: Mitigating the Straggler Effect in Mixture of Experts","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T00:41:06.928901Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2503.05066"},"observation_digest":"sha256:191c184004edb8c49f974a3007d467d1430a22f2ec19aff78222d7357f862cb7","observation_id":"516d51f7-c38a-44a3-bc4d-355dbeb60f78","resolution":{"observed_at":"2026-05-23T00:42:19.055339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2503.12844","last_updated":"2026-04-30T06:09:00Z","snapshot_observed_at":"2026-07-06T20:53:41.124209Z","submitted_at":"2025-03-17T05:43:40Z","title":"GuideDog: A Real-World Egocentric Multimodal Dataset for Blind and Low-Vision Accessibility-Aware Guidance","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T23:49:53.830731Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2503.12844"},"observation_digest":"sha256:7bab4ff9cf646c0c4e4ca05b80674ed5a93cce121c2a304581d460a1751e596e","observation_id":"0a8b3b20-0fc7-480b-8f5d-bd4d388550d3","resolution":{"observed_at":"2026-05-22T23:52:17.046567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T20:23:50.552549Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2504.05299"},"observation_digest":"sha256:30f5be1cfdd8c410dad37c91df3182d0c83fae55eff4b9bf6d3b5726976654cc","observation_id":"5e0975f2-ce4c-4ade-b961-4636735b67c7","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2504.09925","last_updated":"2026-04-29T06:12:36Z","snapshot_observed_at":"2026-08-02T07:57:37.201421Z","submitted_at":"2025-04-14T06:33:29Z","title":"FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T19:49:00.961388Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2504.09925"},"observation_digest":"sha256:7bc5581df6898e5a0fd37c55f817e8887889ab18843f341220f9c80584064d38","observation_id":"83a0b490-906e-40ed-b2b5-23d309d7b10e","resolution":{"observed_at":"2026-05-22T19:52:01.951522Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:f4d1842c821d0be7febf38a86c4eccb2eed45c72a165142e7579eaaaa514ce39","observation_id":"e00a2882-d65a-4442-a090-1dfebde268d7","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2504.13181","last_updated":"2025-04-28T18:01:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T17:59:57Z","title":"Perception Encoder: The best visual embeddings are not at the output of the network","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T22:21:15.681336Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2504.13181"},"observation_digest":"sha256:613fe4525f491dd28fcb3b45abc56b60817bdfe98cafc83e875e1bd7bd184df4","observation_id":"c7776a7b-b344-498d-ab3f-2aeff41dcc31","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:7770a0aa56ef86b5829d1f6682f2677f33b49619feedcb92af029286c9d17ef1","observation_id":"4903c79d-2e7a-4715-ba10-a683ddc771bf","resolution":{"observed_at":"2026-05-22T18:05:00.971979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:5c609f8e366326381300c00069163e4f87a649f8cba4f3d98be3fab155edb4d8","observation_id":"e4e88b71-6c17-4e55-9f22-d64811bd6c3d","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2505.19662","last_updated":"2026-06-07T05:49:00Z","snapshot_observed_at":"2026-08-01T14:27:47.969573Z","submitted_at":"2025-05-26T08:21:46Z","title":"FieldWorkArena: Agentic AI Benchmark for Real Field Work Tasks","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T14:36:30.827705Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2505.19662"},"observation_digest":"sha256:5f8c6d22c4766ebcf9003e0bc52550649218a8179b16033e88eba1e33f4ae808","observation_id":"684ca5b8-d3d0-49be-9698-c82e50151a9e","resolution":{"observed_at":"2026-05-19T14:37:35.827439Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-02T04:30:21.704758Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T01:05:18.801388Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2505.23678"},"observation_digest":"sha256:00cf54ed4bf18caee38ce08ea8567169ff1521e95380b15b4f381896b314e371","observation_id":"228a6080-83c3-463e-8d1a-0a851b2d3eb3","resolution":{"observed_at":"2026-05-22T01:05:52.112924Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2506.00721","last_updated":"2026-04-04T02:19:01Z","snapshot_observed_at":"2026-07-30T08:35:22.353423Z","submitted_at":"2025-05-31T21:42:12Z","title":"Common Inpainted Objects In-N-Out of Context","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T11:38:44.069681Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2506.00721"},"observation_digest":"sha256:314f06f3dddc1d9ba5a6360ea6a6e84a25596f1a2c20aff84748d3d816a7a81a","observation_id":"261929bf-d31d-44c9-9e91-484d0399b0e0","resolution":{"observed_at":"2026-05-19T11:42:15.998907Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2507.01925","last_updated":"2025-07-02T17:34:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:34:52Z","title":"A Survey on Vision-Language-Action Models: An Action Tokenization Perspective","version":1},"reference_index":182,"source":"pdf_text","source_observed_at":"2026-05-17T14:08:34.893876Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2507.01925"},"observation_digest":"sha256:6fa7e8b766c54cd306bdd78e7c4477255d7b92763c9500d8da04f80da6ec3ffc","observation_id":"003da85c-77e9-43e6-b3b6-1f9d9fa16fb6","resolution":{"observed_at":"2026-05-17T14:08:35.062910Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2507.05920","last_updated":"2026-04-20T01:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T12:05:05Z","title":"High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T06:10:57.219445Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2507.05920"},"observation_digest":"sha256:eb3a653ac78f688ed70eda23fade15b53e7fe046706e372f30cc3b41c8bc8389","observation_id":"7f2e98f7-69b6-4ef1-a6ce-cad52c7a2f7e","resolution":{"observed_at":"2026-05-19T06:12:07.024774Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2507.13868","last_updated":"2026-04-20T09:26:23Z","snapshot_observed_at":"2026-08-05T21:44:37.970364Z","submitted_at":"2025-07-18T12:42:30Z","title":"When Seeing Overrides Knowing: Disentangling Knowledge Conflicts in Vision-Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-19T03:51:17.765919Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2507.13868"},"observation_digest":"sha256:8e384dee569788f683fccacd75f7462ca25973e8ee03035b84e3abebbed6c88e","observation_id":"15df2ffb-9ffc-4e60-b1fb-34703a5eb7c9","resolution":{"observed_at":"2026-05-19T03:52:01.496231Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T21:54:26.182917Z","title":"Molmo and PixMo: Open weights and open data for state-of-the-art multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07814","last_updated":"2025-08-11T09:56:33Z","snapshot_observed_at":"2026-08-05T21:54:24.072352Z","submitted_at":"2025-08-11T09:56:33Z","title":"SwarmVLM: VLM-Guided Impedance Control for Autonomous Navigation of Heterogeneous Robots in Dynamic Warehousing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:26.182917Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2508.07814"},"observation_digest":"sha256:c514784e98420722694310652e1bd860e6422fca2407e5dedd3eef0788fdcec9","observation_id":"252da190-80c1-4f35-97da-cae95083c03e","resolution":{"observed_at":"2026-08-05T21:54:26.182917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2508.13998","last_updated":"2026-04-06T03:29:44Z","snapshot_observed_at":"2026-08-03T11:31:47.613184Z","submitted_at":"2025-08-19T16:50:01Z","title":"Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T22:04:34.235731Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2508.13998"},"observation_digest":"sha256:1ba3258c67dec0c3ceabee41eaea9d336aa3b3d9a02bc9f9eda9f268e72ae55e","observation_id":"36458622-c441-4ed3-9332-8a5e2e1554c7","resolution":{"observed_at":"2026-05-18T22:06:51.660243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T11:58:58.660564Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2508.18265"},"observation_digest":"sha256:480c792cde6c51e12373ed839b10dfee0051582b6c8122d1853eca996a1f8d8f","observation_id":"0cce3dfb-280c-4057-949d-81b8e2770e95","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T12:28:29.027544Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:29.027544Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:1545730d33418441d68669c1ae4732438f7f432d4a50e323f8645b39b5658f1d","observation_id":"f696242a-dd65-4674-8dfc-64c84568f856","resolution":{"observed_at":"2026-08-05T12:28:29.027544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T12:27:27.318382Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multi- modal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.318382Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:e46cb245684f3af9febaa55c956fa4c621cc710f799f2baa3d9af8a75723c987","observation_id":"90da2d0b-414b-43cc-878b-39ed1d204b76","resolution":{"observed_at":"2026-08-05T12:27:27.318382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T12:27:04.911262Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01656","last_updated":"2025-09-01T17:57:49Z","snapshot_observed_at":"2026-08-06T02:38:32.042356Z","submitted_at":"2025-09-01T17:57:49Z","title":"Reinforced Visual Perception with Tools","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T12:27:04.911262Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2509.01656"},"observation_digest":"sha256:b60f5eb1c7062f70c44b38b1f7ff477976286d7f27c48481e8757eafd822c2a1","observation_id":"4026b94f-1a6f-412c-81d3-6e399801e536","resolution":{"observed_at":"2026-08-05T12:27:04.911262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T11:30:12.840402Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02753","last_updated":"2025-09-02T19:01:46Z","snapshot_observed_at":"2026-08-05T11:30:11.536139Z","submitted_at":"2025-09-02T19:01:46Z","title":"LExI: Layer-Adaptive Active Experts for Efficient MoE Model Inference","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T11:30:12.840402Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2509.02753"},"observation_digest":"sha256:128d85924162481de0fd98d39a90914585cd698ee6eb3737da6abc8323823d24","observation_id":"dd4df457-7e3a-4575-93f0-db03883c2852","resolution":{"observed_at":"2026-08-05T11:30:12.840402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T10:37:52.209256Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03893","last_updated":"2025-09-04T05:39:16Z","snapshot_observed_at":"2026-08-05T10:37:49.602672Z","submitted_at":"2025-09-04T05:39:16Z","title":"Weakly-Supervised Learning of Dense Functional Correspondences","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T10:37:52.209256Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2509.03893"},"observation_digest":"sha256:eee26bbb36b23e1c1e75cde13b02d00acd3faf25b13936b848e838c328291ac5","observation_id":"44068fd0-5849-4e91-bf7d-b33f4cf17e88","resolution":{"observed_at":"2026-08-05T10:37:52.209256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T10:34:18.332552Z","title":"Preprint, arXiv:2409.17146","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03986","last_updated":"2025-09-04T08:13:06Z","snapshot_observed_at":"2026-08-05T10:34:14.354470Z","submitted_at":"2025-09-04T08:13:06Z","title":"Promptception: How Sensitive Are Large Multimodal Models to Prompts?","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T10:34:18.332552Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2509.03986"},"observation_digest":"sha256:71ae5e1657e665b9aeb8223ef35f5da498a6f3aa44d733dd4baf105f9965be0a","observation_id":"8d539798-7a22-43b1-a53d-fab53a9356a0","resolution":{"observed_at":"2026-08-05T10:34:18.332552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-04T19:27:40.625058Z","title":"Deitke, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09254","last_updated":"2025-09-11T08:39:08Z","snapshot_observed_at":"2026-08-04T19:27:38.196956Z","submitted_at":"2025-09-11T08:39:08Z","title":"Towards Better Dental AI: A Multimodal Benchmark and Instruction Dataset for Panoramic X-ray Analysis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T19:27:40.625058Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2509.09254"},"observation_digest":"sha256:45d9189f45bd119757532526ec3bb6d8368bed08b0271b2ad24fb29bc23e46e8","observation_id":"130cf91b-85ff-4fd1-989f-523aa9f82f7d","resolution":{"observed_at":"2026-08-04T19:27:40.625058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-04T17:16:45.186493Z","title":"Deitke, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11020","last_updated":"2025-09-14T01:13:03Z","snapshot_observed_at":"2026-08-06T11:47:05.937284Z","submitted_at":"2025-09-14T01:13:03Z","title":"Improving Fungi Prototype Representations for Few-Shot Classification","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T17:16:45.186493Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2509.11020"},"observation_digest":"sha256:f8cf60ba806aa3cd6bf0a8f67db20747453bff613374021c7fe4c5fcfe9e0be0","observation_id":"4964d9db-8401-4b26-bb24-e2b2d0c1c663","resolution":{"observed_at":"2026-08-04T17:16:45.186493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2510.13778","last_updated":"2025-10-15T17:30:05Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:30:05Z","title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T20:09:39.677347Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2510.13778"},"observation_digest":"sha256:f36f40e6e17764501f923a9cc1c4f91e5c77988063a784c4324f77a2e330a94f","observation_id":"7460dde3-c7a3-4c46-9163-9122caeb58c0","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2510.23642","last_updated":"2026-04-07T20:59:49Z","snapshot_observed_at":"2026-08-03T12:10:55.627478Z","submitted_at":"2025-10-24T18:03:57Z","title":"VisCoder2: Building Multi-Language Visualization Coding Agents","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T04:13:59.418835Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2510.23642"},"observation_digest":"sha256:60af4f0cc27b67e38beddb385508ae2e10b02c876c3250a19092ebbaa6a60f07","observation_id":"9e3b4d55-2dda-411b-94b2-20e4b964ecfd","resolution":{"observed_at":"2026-05-18T04:15:51.813368Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2511.16857","last_updated":"2026-04-19T05:15:27Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-20T23:54:15Z","title":"BOP-ASK: Object-Interaction Reasoning for Vision-Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T19:58:19.309634Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2511.16857"},"observation_digest":"sha256:f3a28908b01c9f6b51fa82d5938495ec9a604cc01d43f67b27c8220f54854fc0","observation_id":"68d4ffd2-bfd0-4552-8927-d520ca3ab30f","resolution":{"observed_at":"2026-05-17T20:00:10.747887Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2602.13193","last_updated":"2026-04-06T03:04:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-13T18:57:56Z","title":"Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T22:05:39.797848Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2602.13193"},"observation_digest":"sha256:a4dcfddceea8ebe7ddc4b5d72ad7c20406d808cee9478f8823e8e1aba877cdfb","observation_id":"8250275f-ec65-4132-b714-23b7b4b0cd99","resolution":{"observed_at":"2026-05-15T22:06:42.948643Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2602.13310","last_updated":"2026-05-07T08:00:36Z","snapshot_observed_at":"2026-08-03T02:11:51.693223Z","submitted_at":"2026-02-10T03:53:25Z","title":"Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T03:27:53.694506Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2602.13310"},"observation_digest":"sha256:4ad83e4ed755c3aef90197681a78d06fa7b8075e611c9606c2c810d7e896b8c2","observation_id":"ec8ba832-38b1-4df0-ae51-2522ed3c6018","resolution":{"observed_at":"2026-05-16T03:30:33.058511Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2602.22779","last_updated":"2026-06-03T09:11:47Z","snapshot_observed_at":"2026-08-02T20:38:33.149530Z","submitted_at":"2026-02-26T09:15:34Z","title":"TrajTok: Learning Trajectory Tokens enables better Video Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T19:11:52.694778Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2602.22779"},"observation_digest":"sha256:6c403569d466bdda242ca89b8da48a37db1e59163cb4d223c71d4f0224eb877f","observation_id":"4710ed8f-9d25-446f-9330-8a9faee53e69","resolution":{"observed_at":"2026-05-15T19:16:31.831336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-02T20:38:37.346586Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art vision-language models.arXiv preprint arXiv:2409.17146, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.22779","last_updated":"2026-06-03T09:11:47Z","snapshot_observed_at":"2026-08-02T20:38:33.149530Z","submitted_at":"2026-02-26T09:15:34Z","title":"TrajTok: Learning Trajectory Tokens enables better Video Understanding","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T20:38:37.346586Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2602.22779"},"observation_digest":"sha256:4ab8dab9ffd7f8fe4522db2516f6756b878e7e0cfba4814e99ce556d143fe07b","observation_id":"8cdd0965-97dd-46f2-9f63-c90efe162aaf","resolution":{"observed_at":"2026-08-02T20:38:37.346586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-02T18:31:40.819754Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.09971","last_updated":"2026-07-28T19:12:58Z","snapshot_observed_at":"2026-08-04T15:14:09.655279Z","submitted_at":"2026-03-10T17:59:00Z","title":"TiPToP: A Modular Open-Vocabulary Robot Manipulation System That Plans","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T18:31:40.819754Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2603.09971"},"observation_digest":"sha256:ba6fd45f219dadff2ccee92b9457bc78cb88ceeba3fe8bfa61ed0960e4f2f5d4","observation_id":"da3b6ecc-b7da-44d6-93c5-a7b33b8e36b0","resolution":{"observed_at":"2026-08-02T18:31:40.819754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-02T17:52:42.744282Z","title":"URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.19802","last_updated":"2026-07-15T11:20:38Z","snapshot_observed_at":"2026-08-05T11:41:04.583885Z","submitted_at":"2026-03-20T09:40:41Z","title":"Evaluating Vision Foundation Models for Pixel and Object Classification in Microscopy","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T17:52:42.744282Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2603.19802"},"observation_digest":"sha256:e0f0aa528967d3d073beb4565a5238fa820e5597bf1e79ea7adc9389e08f2be9","observation_id":"3a115856-c175-4260-8ee8-46c105ffe1f3","resolution":{"observed_at":"2026-08-02T17:52:42.744282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2604.05672","last_updated":"2026-04-15T03:34:03Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T10:18:40Z","title":"A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T19:31:23.255452Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2604.05672"},"observation_digest":"sha256:2f2ea9a2ef1961309bc9193b76d652a6233a686a2093bd8aeb68f27ccf47d53c","observation_id":"271ab0f9-1f78-4a54-88dc-b679a7b170dd","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2604.08050","last_updated":"2026-04-09T09:58:56Z","snapshot_observed_at":"2026-07-06T22:57:13.745326Z","submitted_at":"2026-04-09T09:58:56Z","title":"ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T17:55:12.551127Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2604.08050"},"observation_digest":"sha256:b082e714ecc9d2053f48bad00f959edb2472db106c4e44875666b2fa1ae186fd","observation_id":"211cac15-8573-4f9a-b6de-edb2618fc9f0","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2604.08456","last_updated":"2026-04-09T16:51:42Z","snapshot_observed_at":"2026-07-06T22:57:31.046146Z","submitted_at":"2026-04-09T16:51:42Z","title":"Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T17:14:11.941977Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2604.08456"},"observation_digest":"sha256:00cd43b039e99d13025757f589a62ee1690c459979438d11ef0acf32efdb04c2","observation_id":"4828e8f5-3a9c-4eac-a049-45900830e3db","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2604.11490","last_updated":"2026-04-16T23:50:04Z","snapshot_observed_at":"2026-07-06T22:59:54.573362Z","submitted_at":"2026-04-13T13:56:00Z","title":"Anthropogenic Regional Adaptation in Multimodal Vision-Language Model","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T16:29:12.064221Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2604.11490"},"observation_digest":"sha256:c0443210df30f99a11a1e6366bec362855b13a9d943c94d8b01f90a792890736","observation_id":"5e4c86e9-9082-4271-9169-156300307c1c","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2604.17472","last_updated":"2026-04-19T14:53:38Z","snapshot_observed_at":"2026-07-06T23:04:32.734175Z","submitted_at":"2026-04-19T14:53:38Z","title":"UniMesh: Unifying 3D Mesh Understanding and Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T06:55:42.679323Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2604.17472"},"observation_digest":"sha256:57252eac6e7b2bba4f339bff97a2aee1c2b32c1d5343c310adf37ab19874de07","observation_id":"cb95ea42-25b9-47d4-87b4-59507d6e45a9","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2604.27472","last_updated":"2026-04-30T06:14:02Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:14:02Z","title":"PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-07T08:56:32.164424Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2604.27472"},"observation_digest":"sha256:4ff7fceaa71441b2d69b37a329096dc58b913ed3895c2b34263e94f444183321","observation_id":"10fe9bf2-e95c-4301-af01-7f0d9f1eacf2","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2605.02487","last_updated":"2026-05-10T07:20:32Z","snapshot_observed_at":"2026-07-06T23:15:32.349713Z","submitted_at":"2026-05-04T11:41:28Z","title":"Visibility-Aware Mobile Grasping in Dynamic Environments","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-08T18:01:30.332804Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2605.02487"},"observation_digest":"sha256:666fe12ed0f0d3ef57ed7a6232d9ccbda5d02553a1614d8ebc044129f7356f7f","observation_id":"65f28d80-14f7-4cae-a642-f088e0e49f94","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2605.02487","last_updated":"2026-05-10T07:20:32Z","snapshot_observed_at":"2026-07-06T23:15:32.349713Z","submitted_at":"2026-05-04T11:41:28Z","title":"Visibility-Aware Mobile Grasping in Dynamic Environments","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:09.146674Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2605.02487"},"observation_digest":"sha256:ba07f4cae84fa355407a647dea3023bfcb998521138b15a95adde4efe05f0112","observation_id":"298e1376-4c87-480c-92b1-cf60ddfbc751","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2605.05045","last_updated":"2026-05-10T12:13:49Z","snapshot_observed_at":"2026-07-06T23:17:43.402046Z","submitted_at":"2026-05-06T15:41:24Z","title":"When Relations Break: Analyzing Relation Hallucination in Vision-Language Model Under Rotation and Noise","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:14.089081Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2605.05045"},"observation_digest":"sha256:7899e648cb767cfbb0505d836e1ca5e95cac55397ba636f633111204fa73a8ae","observation_id":"c1a3f6cf-72a5-4c82-bce2-7e8d88395cb3","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2605.05045","last_updated":"2026-05-10T12:13:49Z","snapshot_observed_at":"2026-07-06T23:17:43.402046Z","submitted_at":"2026-05-06T15:41:24Z","title":"When Relations Break: Analyzing Relation Hallucination in Vision-Language Model Under Rotation and Noise","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T03:52:44.531016Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2605.05045"},"observation_digest":"sha256:4f02d8e2ff5a4a9c5e486a252ffa056a791cc5c1c421dd6b2f9b6fd7b70a3921","observation_id":"ee9e83c5-b2d8-4f7a-8f53-39c69e9ad358","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T02:52:43.674969Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:29328c51198e80e45632e1a045fce6678096714335900ab292b34a3b819bae75","observation_id":"605ca1b7-7702-4d2d-af34-4d419a2969c6","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T21:28:37.680681Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:ec2e9b8bde4300249750f044e4fb1d8913a31bca8f3c10671d237a860bcd7b65","observation_id":"99da1db6-1974-4923-912d-a95c4bcd97d1","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2605.19420","last_updated":"2026-05-19T06:12:59Z","snapshot_observed_at":"2026-08-04T03:47:28.415645Z","submitted_at":"2026-05-19T06:12:59Z","title":"Beyond Waypoints: Dual-Heatmap Grounding for Cross-Embodiment Semantic Navigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T05:53:31.627150Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2605.19420"},"observation_digest":"sha256:e29f966dbf0e98461e30df105fb86ec5be433b386be3bf130979fb27ce09a575","observation_id":"f2b47308-92f2-48b3-a1bb-140b9b36d1ea","resolution":{"observed_at":"2026-05-20T05:58:05.388019Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2605.25427","last_updated":"2026-05-25T04:58:23Z","snapshot_observed_at":"2026-07-06T23:35:21.734804Z","submitted_at":"2026-05-25T04:58:23Z","title":"Binding Visual Features Point by Point","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T22:56:44.793896Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2605.25427"},"observation_digest":"sha256:f0ea6578f0d67e840c372ad3145c420cd670667e8c874f7241017e8782649903","observation_id":"3754e66a-e946-447b-a587-ed2e7a417482","resolution":{"observed_at":"2026-06-29T23:44:03.290485Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2605.25979","last_updated":"2026-05-25T15:54:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T15:54:04Z","title":"LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T22:12:05.365596Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2605.25979"},"observation_digest":"sha256:2070db4b71abd66d79728c0902e43ea8775e391b99aafe88ca1d55b55126e2ed","observation_id":"09a2392a-73ee-43b9-86d8-e8694f9d8ab5","resolution":{"observed_at":"2026-06-29T22:13:59.623529Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2605.28023","last_updated":"2026-05-27T06:27:04Z","snapshot_observed_at":"2026-08-02T21:20:31.316522Z","submitted_at":"2026-05-27T06:27:04Z","title":"VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T13:13:57.599970Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2605.28023"},"observation_digest":"sha256:05d7d0bd62e218e4c4b17ae15cf711a2d29c45afd15641182f44d30703113cdd","observation_id":"0b7fb262-8dd6-44cb-ab57-d65d0ccf9d8e","resolution":{"observed_at":"2026-06-29T13:23:28.479602Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2606.03392","last_updated":"2026-06-02T09:34:08Z","snapshot_observed_at":"2026-07-06T23:43:40.769504Z","submitted_at":"2026-06-02T09:34:08Z","title":"OpenEAI-Platform: An Open-source Embodied Artificial Intelligence Hardware-Software Unified Platform","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T09:31:56.289129Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2606.03392"},"observation_digest":"sha256:66aab5069f4336a4bc013465e35d48e4fc4721e9628358207f0c543a73cdbe12","observation_id":"8338fa87-ef7c-4a6a-a574-7e2476c4d907","resolution":{"observed_at":"2026-07-02T03:56:35.248704Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2606.03626","last_updated":"2026-06-02T13:25:05Z","snapshot_observed_at":"2026-08-02T20:54:43.329538Z","submitted_at":"2026-06-02T13:25:05Z","title":"TurtleAI: Benchmarking Multimodal Models for Visual Programming in Turtle Graphics","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T10:28:00.090116Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2606.03626"},"observation_digest":"sha256:022727975420556172afc3da2c9ffbf63f7a36741b372b5e3f7c4d3591fd6528","observation_id":"186f8c83-491b-466e-a3c9-99a916e9a67c","resolution":{"observed_at":"2026-07-02T02:56:29.434215Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2606.04282","last_updated":"2026-06-02T23:14:46Z","snapshot_observed_at":"2026-07-06T23:44:23.633099Z","submitted_at":"2026-06-02T23:14:46Z","title":"FindIt: A Format-Informed Visual Detection Benchmark for Generalist Multimodal LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T10:16:53.915716Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2606.04282"},"observation_digest":"sha256:40ca3e99df72c50611cec3ca73f49933524a4fc4068500ae80c3a4c4a13b04d2","observation_id":"2991a7a4-e583-4535-9552-f3ac570c3285","resolution":{"observed_at":"2026-07-02T03:06:30.404545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2606.07723","last_updated":"2026-06-05T16:21:27Z","snapshot_observed_at":"2026-08-02T03:37:35.733251Z","submitted_at":"2026-06-05T16:21:27Z","title":"VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T21:40:00.330510Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2606.07723"},"observation_digest":"sha256:535f6d1ac255a08f55e8c905b7413faf59e8f97de66d7c52d0b94912e3fa62dd","observation_id":"429dbaf1-c476-4e4c-8d6e-99e6ec024e7e","resolution":{"observed_at":"2026-07-02T19:07:18.187904Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2606.09859","last_updated":"2026-05-31T13:02:00Z","snapshot_observed_at":"2026-07-31T15:38:52.520560Z","submitted_at":"2026-05-31T13:02:00Z","title":"Mitigating Manifold Departure: Uncertainty-Aware Subspace Rectification for Trustworthy MLLM Decoding","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-28T17:51:38.268304Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2606.09859"},"observation_digest":"sha256:dd4e2dea45f90d7d4c720b03187e4cd71c74dda3eb7f8b28714fa32242c83c76","observation_id":"dff2304c-45b6-45ef-ba6e-d4833df9e37c","resolution":{"observed_at":"2026-06-28T17:52:27.179206Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2606.10651","last_updated":"2026-06-09T09:58:08Z","snapshot_observed_at":"2026-07-06T23:49:51.672382Z","submitted_at":"2026-06-09T09:58:08Z","title":"Kwai Keye-VL-2.0 Technical Report","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-27T13:53:10.352603Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2606.10651"},"observation_digest":"sha256:e71537308a3d8dc4870caf748e9eecbfc4223803389f0fa740a44816e477c8e1","observation_id":"d41d686e-968f-4083-9174-6917fd592dfe","resolution":{"observed_at":"2026-07-03T04:27:37.148270Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-07-06T23:53:40.698123Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":126,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:f860daf2e4338a62d5ae74e35236b9d0b374fae44acc56260769f747fbc811c2","observation_id":"8dc55f05-b5d0-4062-baa6-a9031859f552","resolution":{"observed_at":"2026-07-03T20:48:56.137353Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2606.19950","last_updated":"2026-06-18T08:49:11Z","snapshot_observed_at":"2026-08-06T06:19:12.690187Z","submitted_at":"2026-06-18T08:49:11Z","title":"Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T17:49:38.151224Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2606.19950"},"observation_digest":"sha256:eba532c7bd6c961bb0bd07c644fe38d3cfcb4a0ab4afea7e897cf67a08d7be36","observation_id":"171174b7-0028-4b2f-b4ed-77c362ac8346","resolution":{"observed_at":"2026-07-04T03:39:30.305306Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2606.29850","last_updated":"2026-06-29T06:39:03Z","snapshot_observed_at":"2026-08-05T18:21:22.153425Z","submitted_at":"2026-06-29T06:39:03Z","title":"Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T06:43:39.125052Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2606.29850"},"observation_digest":"sha256:ade3f19aefb2ba2ed370ee9ac8a1581c8f9a8fcf2f12beb82362b0f121f5bbba","observation_id":"87be315a-80fe-4ba8-a9d9-6b8367d7d947","resolution":{"observed_at":"2026-06-30T06:44:18.638769Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2607.02512","last_updated":"2026-07-02T17:59:50Z","snapshot_observed_at":"2026-07-07T00:07:56.573640Z","submitted_at":"2026-07-02T17:59:50Z","title":"Program-as-Weights: A Programming Paradigm for Fuzzy Functions","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-03T16:17:59.522449Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2607.02512"},"observation_digest":"sha256:9ad62d65a6844cb8e8bf9f10af1bb3320373f316dca8ca8e0cdedf8fb2f66290","observation_id":"24835933-4e67-4a74-9600-2c350fc5ca88","resolution":{"observed_at":"2026-07-03T16:18:37.231396Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2409.17146 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":231,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:17c2c9d84fde387b9281425fab66eee7836f103dced9b7ae9564b8b71a9f3410","observation_id":"ca4cabcf-6b18-4f73-b78c-c9855e5d509d","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-07-12T01:50:59.184754Z","title":"arXiv preprint arXiv:2409.17146 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03530","last_updated":"2026-07-03T17:59:58Z","snapshot_observed_at":"2026-08-04T18:44:44.436706Z","submitted_at":"2026-07-03T17:59:58Z","title":"MentalThink: Shaping Thoughts in Mental SVG World","version":1},"reference_index":284,"source":"arxiv_source","source_observed_at":"2026-07-12T01:50:59.184754Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2607.03530"},"observation_digest":"sha256:f534e62fca5cd59ff7505d3b4dc244b53eacb9b08181abce52fc8946cdffc3c2","observation_id":"505b980e-1fb0-44cb-938a-fcb73327db0e","resolution":{"observed_at":"2026-07-12T01:50:59.184754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, and Aniruddha Kembhavi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":159,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:899b881df2f7290bcb1fe74e84a0be55681bc1380c1c97953b584ddbbbf864e1","observation_id":"81e3cb87-82b7-4d68-8baa-9e4f70a9d5ec","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-02T06:33:14.240999Z","title":"arXiv:2409.17146","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-02T14:55:22.478767Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:14.240999Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:ae13becb0de951ee1efc9eb695c648c4ee3823e47a2cd058b76aae6eb7adfb42","observation_id":"d30f5a49-2cbe-4992-96d7-716a8ed7b9b0","resolution":{"observed_at":"2026-08-02T06:33:14.240999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-01T08:37:42.483019Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21061","last_updated":"2026-07-23T08:52:11Z","snapshot_observed_at":"2026-08-01T08:37:35.605662Z","submitted_at":"2026-07-23T08:52:11Z","title":"MVEI & EmObserver: Empowering MLLM-Oriented Visual Emotional Intelligence via Emotion Statement Judgement","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T08:37:42.483019Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2607.21061"},"observation_digest":"sha256:c34ed67c9e85d5cd3412d0a0a7a4d225a5409e5d5c6d85bd312877d465060c83","observation_id":"ef0405c2-9e41-413c-b7e9-71406a9ff105","resolution":{"observed_at":"2026-08-01T08:37:42.483019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-07-31T06:18:55.420407Z","title":"Molmo and PixMo: Open weights and open data for state-of-the-art vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24744","last_updated":"2026-07-27T17:59:58Z","snapshot_observed_at":"2026-07-31T06:18:51.908689Z","submitted_at":"2026-07-27T17:59:58Z","title":"Data Pyramid for Embodied Manipulation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-31T06:18:55.420407Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2607.24744"},"observation_digest":"sha256:61c9e76a73ab5d6261a05ccda8ce5e71cc4aba31390849a415eab60f64a98225","observation_id":"5ef0d572-a1e8-495c-afcc-558fd2e7a8f6","resolution":{"observed_at":"2026-07-31T06:18:55.420407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-07-31T06:20:13.807875Z","title":"Molmo and PixMo: Open weights and open data for state-of-the-art vision-language models.arXiv preprint arXiv:2409.17146, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24904","last_updated":"2026-07-27T17:59:53Z","snapshot_observed_at":"2026-08-06T10:42:52.673277Z","submitted_at":"2026-07-27T17:59:53Z","title":"Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:13.807875Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2607.24904"},"observation_digest":"sha256:ab871db451af03b82cd467d011c4d0a76fbfb2b74e1214d7376a1d60c763caec","observation_id":"8dfa9635-ff28-466f-8fe5-ac4da1bda456","resolution":{"observed_at":"2026-07-31T06:20:13.807875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-01T00:49:33.132703Z","title":"Deitke, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26055","last_updated":"2026-07-28T17:59:31Z","snapshot_observed_at":"2026-08-06T02:37:09.433867Z","submitted_at":"2026-07-28T17:59:31Z","title":"$\\pi\\mathbf{R}^2$: Reactive Real-time Flow Policies","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T00:49:33.132703Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2607.26055"},"observation_digest":"sha256:b2b0f5c608c007794700afa192a367e1f6b537b9ee044cc5a91049232d0bf1dc","observation_id":"3506be23-9ce8-4aaa-8b1c-b20d03c98b34","resolution":{"observed_at":"2026-08-01T00:49:33.132703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T04:16:08.346639Z","title":"arXiv preprint arXiv:2409.17146 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04010","last_updated":"2026-08-04T17:59:58Z","snapshot_observed_at":"2026-08-06T11:41:44.073888Z","submitted_at":"2026-08-04T17:59:58Z","title":"ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-05T04:16:08.346639Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2608.04010"},"observation_digest":"sha256:75183250d54d451f5f0be3d567e9ff652ccd769ba04ec934635b1aacdfbc8fa2","observation_id":"1728ff29-10d0-4f86-96de-62aa7cfc815f","resolution":{"observed_at":"2026-08-05T04:16:08.346639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2409.17146/citation-record","integrity":"/paper/2409.17146/integrity","json":"/paper/2409.17146/citation-record.json","paper":"/paper/2409.17146"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":"2404.14219","doi":"10.48550/arxiv.2404.14219","metadata_source":"pith","pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","venue":"cs.CL","work_id":"feef9556-a016-493c-abd2-0c97a23a7ebf","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:a9c70e6f73908c8f65b0782a73c09b519d30a35cb4a3f3672e9d3a3b20740795","observation_id":"8d916b44-044f-43ce-999e-1e801b25f4e3","resolution":{"observed_at":"2026-05-15T01:55:12.614106Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TallyQA: Answering complex counting questions","venue":null,"work_id":"5fffefa5-8d0c-41c7-8851-b92effa36890","year":2019},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:e8c047008f0dbe80083e9f3afaff1ecd12306840d63b94c1f1d61994d432e178","observation_id":"4f641411-604c-47e7-b3b8-01b6f4a3ac00","resolution":{"observed_at":"2026-05-15T01:55:12.775441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":"2410.07073","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-07-04T13:59:52.216141Z","title":"Pixtral 12B","venue":"cs.CV","work_id":"9ad2b071-82d8-4cfa-b994-b9975094b575","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:0da0920e4839264dc85911f820313d501c8cfb04828a6ab32d357862a6fb016e","observation_id":"66afdab2-c2de-4c04-a32c-70269fe46219","resolution":{"observed_at":"2026-05-15T01:55:12.555156Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":"2403.04652","doi":"10.48550/arxiv.2403.04652","metadata_source":"pith","pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Yi: Open Foundation Models by 01.AI","venue":"cs.CL","work_id":"8efee8a1-5e3c-4851-9c65-18e3d1d9e769","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:49d8e18d42bd0e9d2d8150e13444188470f3708da8ef28e54a61a0daa3644efe","observation_id":"175d3db8-aadb-45a9-a5b7-84b6d9cb67bd","resolution":{"observed_at":"2026-05-15T01:55:12.558215Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:8fbee42bd7279a80369b6983687cd04c78e4c33fdc81fe63a811c92ebc50ce0c","observation_id":"8d3e417b-c926-43b2-a6db-3b7376cf41a0","resolution":{"observed_at":"2026-05-15T01:55:12.561796Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"a0a81c45-4b0d-43e1-bddf-24c4cf031a9c","year":2022},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:78fd3513dfe0a019ad1d0b138c440eda886fd0ff4b98223512c2274c71b74b31","observation_id":"c6af7ef7-eff2-4d66-8b95-a607f242baab","resolution":{"observed_at":"2026-05-15T01:55:12.783582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"e5abb6c7-f2d0-458d-ba29-ad8828ece7cf","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:f6cbe082c68684120f3f7cf674e2efc35a5b6152b01965dc8c482989df1a7428","observation_id":"9f6b7d5b-83e7-4505-93f4-18e264455955","resolution":{"observed_at":"2026-05-15T01:55:12.785439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Layer normalization","venue":null,"work_id":"d000f5cb-998c-4eb5-a886-8e848dadd597","year":2016},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:c71259552c999461284ba0fd5048b53f6db918193c5e258dbc850515558d36fd","observation_id":"e187df9f-bee6-468b-940d-dec9ac9dc948","resolution":{"observed_at":"2026-05-15T01:55:12.787144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fuyu-8b: A multimodal architecture for ai agents","venue":null,"work_id":"7aa08990-c919-4e37-96ec-881582568e5e","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:4c5611068184ac905e15aa47b6d7a3e891fe6851f35904b688687ca3927a2535","observation_id":"27e7d071-5587-4757-8e1c-08f729938d42","resolution":{"observed_at":"2026-05-15T01:55:12.788966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:8339e1efd96a1f038a7ad4a72254798f436d0222f124e4ab80f43d7725440faa","observation_id":"aa522005-f79e-433f-adfd-34aef21ec019","resolution":{"observed_at":"2026-05-15T01:55:12.564804Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scene text visual question answering","venue":null,"work_id":"cbd137c8-db98-42d2-b149-8594094fae1b","year":2019},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:f9e0bfa35ad628ccbf88ad5045c6e67e9e81a6e1e4c4ef59b307e8a384cf0204","observation_id":"8c16d6ae-a6dd-4ee4-a60f-c6ac72f5042f","resolution":{"observed_at":"2026-05-15T01:55:12.792436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":"0b593b2e-dd66-455c-bbfe-188d83564183","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:cd53303d0b39bc7c033a3606da4bbdc96113a2f6e1300f57c7b755ace29605dc","observation_id":"2b1945b4-3e19-4b00-866e-9e9ffca1aefe","resolution":{"observed_at":"2026-05-15T01:55:12.794555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:fbf45ad5d73e40755254fc6a42aedc4d18d20b4cc67c419547b0f40ea6c4b081","observation_id":"1b9acf5c-c89a-4316-912f-b40cbaa05b3a","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14177","last_updated":"2024-07-19T10:09:51Z","snapshot_observed_at":"2026-07-06T18:48:58.038753Z","submitted_at":"2024-07-19T10:09:51Z","title":"EVLM: An Efficient Vision-Language Model for Visual Understanding","version":1},"cited_work":{"arxiv_id":"2407.14177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14177","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evlm: An efficient vision-language model for visual understanding","venue":null,"work_id":"b6217f7f-32fb-451b-96de-f81d0a3eb00c","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2407.14177","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:3483d6facfbd7b557534fee94be8ed75e6fa268d13a2af5fbb4a2226c7d39c1e","observation_id":"0c4271e4-c97b-4810-9b10-48639d805bf4","resolution":{"observed_at":"2026-05-15T01:55:12.572829Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":"2311.12793","doi":"10.48550/arxiv.2311.12793","metadata_source":"pith","pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":"cs.CV","work_id":"90e2b26a-3d27-4567-86b5-929b582a8034","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:1c1fdf20cd5ffa4140bcdb18a4448d8fe58a07be930b83d5331d1362558a74e4","observation_id":"3d13dbdd-8cfd-4bf8-9514-8fd46658da54","resolution":{"observed_at":"2026-05-15T01:55:12.576121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:1e72bbc67e7f9db08c9ec1938a30e7cb159e9b349bfef808e95c9e3e43f5fd01","observation_id":"10afaa3d-1884-4f6b-a3e5-33fb556baf50","resolution":{"observed_at":"2026-05-15T01:55:12.579503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:58712f26b6ae40b582a263e298939e2c3d45f7a68452cf74ea550cf00ec0ebd0","observation_id":"e27abcfe-0a82-4689-8963-6ac137d7c451","resolution":{"observed_at":"2026-05-15T01:55:12.582208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-07-06T16:32:37.715900Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":"2310.09199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-07-02T03:56:35.167882Z","title":"PaLi-3 vision lan- guage models: Smaller, faster, stronger","venue":null,"work_id":"d20a4352-6739-4426-8a5a-b3079cc14d00","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:c2fc08380e2244cf009348abee656bdfc71d8c35b62e11b7970c4416e04a69dd","observation_id":"c9085aad-b652-4417-917f-ead2dd30e829","resolution":{"observed_at":"2026-05-15T01:55:12.585432Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":"2404.16821","doi":"10.48550/arxiv.2404.16821","metadata_source":"pith","pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","venue":"cs.CV","work_id":"3714835e-c5a6-4d7e-950c-be44670ed9e6","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:85f7f98f49e477e12a23c4dd0346e185dd6a45584983c0b49bfc972bb636c771","observation_id":"76eee52b-6244-42d1-9162-682f15aa8c30","resolution":{"observed_at":"2026-05-15T01:55:12.588717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":"953e12a9-1ce9-44bf-9d7d-33638e6a8e91","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:6907a99f2f8164c5d8165932bec85fb304b1df5dfc578412a381f80dd0d5c524","observation_id":"b2d6ab35-3a86-4b40-b859-530942728310","resolution":{"observed_at":"2026-05-15T01:55:12.809689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatbot arena: An open platform for evaluating LLMs by human preference","venue":null,"work_id":"1ce1ac5c-93e6-460c-be8d-1e5dac7c4899","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:2266f7f6e0b5d8a690467d669295dbca533819cc15ba1180df11d9b756f7741c","observation_id":"989c6a9f-11af-4e98-976c-94a7c3d554ac","resolution":{"observed_at":"2026-05-15T01:55:12.811427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:669ec69405352c4ead659276a394509f011bdd2217277322f38c19bab7622c8c","observation_id":"3a7116c2-28ef-48f8-b48b-af9dfecf4bad","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:d11c74e28ed5c2e7430d6dc399df71a56cc56953dd3abcadb4eeb1532aca3b0c","observation_id":"13fcd1d4-5482-468c-a429-22af94e90abe","resolution":{"observed_at":"2026-05-15T01:55:12.595184Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:b8a681158f65b04928ae4c9fe901d3350f9ae4e750ba64c1a81af92d4544a669","observation_id":"f65f18fc-2f99-4113-bd09-49470ff73d89","resolution":{"observed_at":"2026-05-15T01:55:12.598652Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On implementing 2d rectangular assignment algo- rithms","venue":null,"work_id":"a5538dc3-8777-44dd-8ca8-052f4b0afc11","year":null},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:11147ebb0eabe52b1c14ac5590bb38290bbad473522d75f2f076608bad8ebd15","observation_id":"5100c3e0-82f6-4c46-8d65-fe867ba98c06","resolution":{"observed_at":"2026-05-15T01:55:12.819569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b5f7ae79-849d-4a49-8e86-9c5ddd457050","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:28d49f8b61268c01ad52e6ab7355b38ef6624cff3a316fc84150fa028e0b515a","observation_id":"51d4a3e9-1270-49c6-b3de-5a379c419fed","resolution":{"observed_at":"2026-05-15T01:55:12.821489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-07-06T19:17:02.745056Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2409.11402","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-07-02T02:56:29.429018Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","venue":null,"work_id":"05897a70-23cd-425f-b903-02c1293c04a0","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:73b47eec96ebad5f55ae69c6b1882449e16029a722ce2dde3339407e2f335a47","observation_id":"16ae0048-5fc7-49ca-96b3-56406959f01c","resolution":{"observed_at":"2026-05-15T01:55:12.601804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FlashAttention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":"c7456d3b-2614-4401-8a8b-5162ed2f791c","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:b6de90e351c2aa638997a5366f3cca2483bf7ef18beba0c987e4e84ba36ca55f","observation_id":"92d86baa-5452-4c60-85bb-c5ede3751c52","resolution":{"observed_at":"2026-05-15T01:55:12.825179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R´e","venue":null,"work_id":"eb0392aa-71a3-4b1a-bf38-3c00c29400f1","year":2022},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:7aa77dced98ec33282ba42932b3fb441eb54b71d1bdefb50d2c3968fc5aca48d","observation_id":"d855a28e-3556-498c-928b-b503bd2928f3","resolution":{"observed_at":"2026-05-15T01:55:12.827016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06512","last_updated":"2024-04-09T17:59:32Z","snapshot_observed_at":"2026-07-06T17:57:56.632041Z","submitted_at":"2024-04-09T17:59:32Z","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","version":1},"cited_work":{"arxiv_id":"2404.06512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.06512","snapshot_observed_at":"2026-07-04T08:19:44.167431Z","title":"Internlm-xcomposer2-4khd: A pioneer- ing large vision-language model handling resolutions from 336 pixels to 4k hd","venue":null,"work_id":"799b1f12-2edc-4b09-a83b-dbd87e1404e7","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2404.06512","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:7162144866edd4d8e1ae01fdb688edae51496b95888ad159f84babb753420b04","observation_id":"0f776ec2-dd71-4348-8b5c-0f340008bf15","resolution":{"observed_at":"2026-05-15T01:55:12.605209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"acd4b2b7-dffd-4f49-af31-62c3f0afd4bf","year":2021},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:2d60cec828f3347dc72bc4b472c5da3fd677dc0ce3589b5086f5bba3596379d2","observation_id":"cbc0f833-6031-4516-88c4-a398773fc0e1","resolution":{"observed_at":"2026-05-15T01:55:12.831454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17453","last_updated":"2024-10-31T23:23:22Z","snapshot_observed_at":"2026-07-06T18:51:23.832577Z","submitted_at":"2024-07-24T17:37:05Z","title":"VILA$^2$: VILA Augmented VILA","version":2},"cited_work":{"arxiv_id":"2407.17453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.17453","snapshot_observed_at":"2026-07-02T11:46:55.437498Z","title":"VILA2: VILA Augmented VILA","venue":null,"work_id":"cda20748-41d3-4441-bd08-7b1038d3a0c0","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2407.17453","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:55eb170809812311b22ebdfb5b2e11e341f0a68ea1bcce1a6b336a13faea9270","observation_id":"0c9c9db9-68f1-43e9-a6a6-5311c3768a0b","resolution":{"observed_at":"2026-05-15T01:55:12.608096Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Devise: A deep visual-semantic embedding model","venue":null,"work_id":"fafe0fe2-82fc-40e1-8b91-f17b9f7b0ffe","year":2013},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:2c568d2ec7f39b830105fa3fa932388c02f0f09d115beb7f922063988956496a","observation_id":"320a91aa-1659-43bd-a7df-d3d95a7f6577","resolution":{"observed_at":"2026-05-15T01:55:12.836760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-07-06T18:58:56.504337Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:9b166c58ef56ee378b3edca3d2fa482565706b08cf4ec4d72e0048ab7bc5c758","observation_id":"5c6a522d-e36f-4c50-bf24-b9a962dfe8a9","resolution":{"observed_at":"2026-05-15T01:55:12.611554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20094","last_updated":"2025-05-08T00:24:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-28T17:59:01Z","title":"Scaling Synthetic Data Creation with 1,000,000,000 Personas","version":3},"cited_work":{"arxiv_id":"2406.20094","doi":"10.48550/arxiv.2406.20094","metadata_source":"pith","pith_arxiv_id":"2406.20094","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Synthetic Data Creation with 1,000,000,000 Personas","venue":"cs.CL","work_id":"4acdd1d7-4a74-460c-a32c-01c386a5c58a","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2406.20094","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:b7910de1b18c448c00d8e230811e43b5eda012c3559aa45d5a9ac4745b2e85c0","observation_id":"6681f19c-668e-4764-9aab-1cf21dff7002","resolution":{"observed_at":"2026-05-16T00:03:55.809567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:49:58.855418+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:49:58.855418+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making the V in VQA matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"74723381-848c-4e60-82ef-34e804a932a7","year":2017},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:f178ec47444da7d538a5273ee9ae8a43f911640f90ee1ea0721cc04c16dd5e5f","observation_id":"0a1676c9-5182-4139-90bd-abeaf258e485","resolution":{"observed_at":"2026-05-15T01:55:12.844532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"21b76a93-8753-4ad9-b161-4b29ab1cc64a","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:f69a1e6d70b851c15aec3cd09229bcff3a7b1ba5a2563de461962a5e3cf0f1fb","observation_id":"363513ea-6dbc-40b0-b13d-08ef640f4f16","resolution":{"observed_at":"2026-05-15T01:55:12.847046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":"1786f24b-48e6-460f-9b92-d51810d63992","year":2021},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:119450e70b2d52ce6d6e234932c5177fdd91984db958c11e95e87412715583d1","observation_id":"b85563b5-15ee-4540-9494-26b27446cbd5","resolution":{"observed_at":"2026-05-15T01:55:12.849514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mea- suring mathematical problem solving with the math dataset","venue":null,"work_id":"b4b4b2e5-6a70-4254-b371-7ef1b6a66896","year":2021},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:76568fadc625773bcb09b0bf4b8cb936ccfdba82475a0591663ba3143e20f622","observation_id":"b418d3cf-72ca-4d4f-8b7b-5937e73adeaa","resolution":{"observed_at":"2026-05-15T01:55:12.851870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accu- mulated gradient normalization","venue":null,"work_id":"b593d2a6-4cc9-4409-81d3-884b6102ca2b","year":2017},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:796bc9cfafbd9276bfd58513bcba901b403516ef53a11c079487bd0c9b6b6332","observation_id":"86082a46-60d2-4806-867e-d9c659cf60b6","resolution":{"observed_at":"2026-05-15T01:55:12.854077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-05T11:54:14.447608Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:c1b27b5d71a26adccd0d4349b31a5490d0fc1ac87e072776149c634e5bb18239","observation_id":"3ed25625-ffcc-4338-b771-77e891f93c84","resolution":{"observed_at":"2026-05-16T20:10:28.051835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"mplug-docowl 1.5: Unified structure learning for ocr-free document understanding","venue":null,"work_id":"2ecb73b0-2cb7-47c5-b1de-bf6d6c6e5f84","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:15703d1b84a8e6b6ae59ec283d92fd737cb4e97baf3a87eea5295cf899c32a1a","observation_id":"bde59e58-be69-461e-a6a5-8f734c3a563e","resolution":{"observed_at":"2026-05-15T01:55:12.859466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"84515e3e-b91e-4227-8abf-94445693246e","year":2021},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:9ce5ba0955d99f2d545dbf8dbc7b84c84cce94ac814f87ca15f7b920a2f64117","observation_id":"235d57ff-4e77-4de5-898e-1407a60d7755","resolution":{"observed_at":"2026-05-15T01:55:12.861657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2405.01483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-07-04T20:40:07.542575Z","title":"Ku, Qian Liu, and Wenhu Chen","venue":null,"work_id":"ca7dd196-dc3e-4e3c-af1e-c0b02fc0efed","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:443f598e6396c3bc74cd79f63dad1e6c5eab8ab4f09f4a232da7710e8c205332","observation_id":"95518f9a-3b1a-4faa-8955-5d1b15b44eb1","resolution":{"observed_at":"2026-05-15T01:55:12.620895Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A shortest augmenting path algo- rithm for dense and sparse linear assignment problems.Computing","venue":null,"work_id":"9be81c44-fc7a-4f10-8784-a7cf21076b7f","year":null},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:11e864f32c6d8a1e7b5c62d67bea0c7ace8452b30335ec09a92b755ca8a90b83","observation_id":"18e20941-9771-4b83-aea7-d2db56a4fc80","resolution":{"observed_at":"2026-05-15T01:55:12.865776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DVQA: Understanding data visualizations via question answering","venue":null,"work_id":"b0100755-ae4b-4478-b278-9b7ae231faf1","year":2018},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:30074ea553740d009093afb37e111957ad217d852ce28db9e1e14073f825491c","observation_id":"69ae4a02-b940-450c-943e-560be1802068","resolution":{"observed_at":"2026-05-15T01:55:12.868532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.07300","last_updated":"2018-02-22T22:50:42Z","snapshot_observed_at":"2026-08-04T06:17:25.388464Z","submitted_at":"2017-10-19T18:01:38Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","version":2},"cited_work":{"arxiv_id":"1710.07300","doi":"10.48550/arxiv.1710.07300","metadata_source":"pith","pith_arxiv_id":"1710.07300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","venue":"cs.CV","work_id":"aa4d846d-b19b-47d6-b5c3-1f61acf0a6a0","year":2017},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/1710.07300","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:9b2229a01497457a644dc9d6575b158e77cb2feebe99396551cde06a9befea6c","observation_id":"809132a1-3500-48e1-be6e-5059b88d2933","resolution":{"observed_at":"2026-05-15T01:55:12.623827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07865","last_updated":"2024-05-30T13:08:48Z","snapshot_observed_at":"2026-08-05T12:05:09.343843Z","submitted_at":"2024-02-12T18:21:14Z","title":"Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models","version":2},"cited_work":{"arxiv_id":"2402.07865","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.07865","snapshot_observed_at":"2026-07-10T07:26:54.452009Z","title":"arXiv preprint arXiv:2402.07865 , year=","venue":"cs.CV","work_id":"b22a99b6-3240-4093-b7b8-de2f53b53610","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2402.07865","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:da9644cb1fb3c1cb340dfe2abd9541755ac5f3ba157f3ad26990393b7366e078","observation_id":"295792de-3296-4a4f-bbc7-0ba24a18c730","resolution":{"observed_at":"2026-05-15T01:55:12.626959Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"63f8cdcf-3404-41f6-bed7-3ea58db5beae","year":2016},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:3fd0df2a5756b145ec43388bff7260666faf2a8b6d5db8d3b0826d55e94f0ab1","observation_id":"58941f00-4e33-426e-ba9c-28ea8bb3938e","resolution":{"observed_at":"2026-05-15T01:55:12.876438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":"fce7864d-2f39-4642-bd94-5523bfe1290c","year":2015},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:ff3317e50073b221795f1acf1dfc7ba5477a1e3ce637eb74b6adf282b7a9f748","observation_id":"f93cecd4-64e1-474e-a157-5ad3b6a8f9ab","resolution":{"observed_at":"2026-05-15T01:55:12.878933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Berg, Wan-Yen Lo, Piotr Doll´ar, and Ross Girshick","venue":null,"work_id":"a8fd2368-8e78-4652-a27d-6d50962f8a63","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:532e618f649d6cf272e184a4d1b9f70dc890aa3c168fa5d3d8e110e1107be26c","observation_id":"e35b5c95-b6f8-4a6c-a3c7-fc9c18609abd","resolution":{"observed_at":"2026-05-15T01:55:12.881620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shamma, Michael S","venue":null,"work_id":"824022c6-a4c4-49ef-b728-49deceb03e00","year":2016},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:db94b034100cb6f95dca59b8e4eae1f2cdd1a1f0e4cc9d35234c71b1bc960db0","observation_id":"22c41068-de0b-4278-883e-0220f1872a23","resolution":{"observed_at":"2026-05-15T01:55:12.883633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relation- ship detection at scale","venue":null,"work_id":"052aba05-34d2-4ab9-9f86-050073445b59","year":2020},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:b97465d87f51cd76b45fb7c3d0040532f12ec51ca75beb6b0837f87cc78a42dc","observation_id":"1b0193d8-2822-4c1f-adfc-bc2c5f70e459","resolution":{"observed_at":"2026-05-15T01:55:12.885894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12637","last_updated":"2024-08-22T17:47:24Z","snapshot_observed_at":"2026-07-06T19:04:47.884694Z","submitted_at":"2024-08-22T17:47:24Z","title":"Building and better understanding vision-language models: insights and future directions","version":1},"cited_work":{"arxiv_id":"2408.12637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.12637","snapshot_observed_at":"2026-07-04T05:39:39.660194Z","title":"Building and Better Understand- ing Vision-Language Models: Insights and Future Directions","venue":null,"work_id":"54aead52-8316-437d-a6cd-78609af679f2","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2408.12637","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:60641ea68d10bcc7659e408426ffefa9100f5a7401f8446cff5ca7bea88173db","observation_id":"33e2b272-aef7-43ed-a3d4-b2fd70c979bb","resolution":{"observed_at":"2026-05-15T01:55:12.630563Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09029","last_updated":"2024-03-14T01:40:40Z","snapshot_observed_at":"2026-07-06T17:44:21.659847Z","submitted_at":"2024-03-14T01:40:40Z","title":"Unlocking the conversion of Web Screenshots into HTML Code with the WebSight Dataset","version":1},"cited_work":{"arxiv_id":"2403.09029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.09029","snapshot_observed_at":"2026-07-08T11:14:55.165249Z","title":"Unlocking the conversion of web screenshots into html code with the websight dataset","venue":"cs.HC","work_id":"ae219ae7-9144-40ce-850a-15d4447a54a2","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2403.09029","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:e557d04f541f376ae680a121f28355298a086e939bfa89db1f708b79d9a59422","observation_id":"88a0a4bb-f973-4747-8366-f7b26dc263b2","resolution":{"observed_at":"2026-05-15T01:55:12.633620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04219","last_updated":"2023-11-07T18:59:58Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T18:59:58Z","title":"OtterHD: A High-Resolution Multi-modality Model","version":1},"cited_work":{"arxiv_id":"2311.04219","doi":"10.48550/arxiv.2311.04219","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Otterhd: A high- resolution multi-modality model","venue":"arXiv (Cornell University)","work_id":"55746fc3-80c7-4185-bc84-6ec4c0095bc5","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2311.04219","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:44d02e1fb8fb1fbd681584f4a389095c8622dbcbdfa41516959cd959c5e2a3a2","observation_id":"73c0fa3e-d4f1-46eb-bce9-1b34fabd9625","resolution":{"observed_at":"2026-05-15T01:55:12.636644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2306.05425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-07-04T19:20:06.537902Z","title":"Mimic-it: Multi-modal in-context instruction tuning","venue":null,"work_id":"17b44aec-3833-47e1-8d2e-e1080a403019","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:f10b2b8d6c3df1e418e70cb6c1da507b3e80731b16282c9505430b25e0c53800","observation_id":"b975245f-b26e-4cf2-ae75-f3254cc1188d","resolution":{"observed_at":"2026-05-15T01:55:12.639738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2305.03726","doi":"10.48550/arxiv.2305.03726","metadata_source":"pith","pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","venue":"cs.CV","work_id":"33cb3a7a-6091-48db-a246-802bbb055f43","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:a0795078f907ec37ce8df2dafeb390093e32a42c82bbfc1d28dcf9bf4c49b3cc","observation_id":"733a87e2-4dcf-4f13-88ca-c5e9c83c261b","resolution":{"observed_at":"2026-05-15T02:43:48.053680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:3a85268844475f2c1e9d6281910328aaf811d6c6684753c22defaa9915057115","observation_id":"0a1fa6ab-bb1e-4d10-8053-2d0f6c1ab2e4","resolution":{"observed_at":"2026-05-15T01:55:12.646452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip: Boot- strapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"b8522680-0435-4138-9b36-3963f5ec5275","year":2022},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:76cfd3deb48b42d27bd94b602c5bfc7b5bb7ec55f325a22e171901163b08000b","observation_id":"175a6c54-d799-48dd-b88f-a9074bf358cd","resolution":{"observed_at":"2026-05-15T01:55:12.726853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Covlm: Composing visual entities and relationships in large language models via communicative de- coding","venue":null,"work_id":"cb53b1c9-02df-4882-9012-895c7db86dcd","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:b2907bff4f293bfc0fa091a6612ec9956ed8297a21914e997d5ee753ea30641d","observation_id":"efaa6182-b356-4a6f-a8b5-8cab6baa616d","resolution":{"observed_at":"2026-05-15T01:55:12.728901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03679","last_updated":"2024-11-13T16:42:22Z","snapshot_observed_at":"2026-08-01T00:25:01.821032Z","submitted_at":"2024-06-06T01:49:29Z","title":"On the Effects of Data Scale on UI Control Agents","version":6},"cited_work":{"arxiv_id":"2406.03679","doi":"10.48550/arxiv.2406.03679","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.03679","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the effects of data scale on ui control agents","venue":"arXiv (Cornell University)","work_id":"545dec08-900c-409f-a10c-7b966b5016f1","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2406.03679","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:e19ed5560464acafe91e5c7bc203f4288372056999e61526c4da5a11ca16e6cc","observation_id":"1f7d1fa6-f636-4c3c-8fce-e625e4fc7b27","resolution":{"observed_at":"2026-05-15T01:55:12.649806Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"7c2cd437-41d5-410b-bba0-7547a4ee1c11","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:e631c7ac8a7b4defe5efcbb3f97f1c58eeece469a9736d5730f5b9a7f1f36a67","observation_id":"fd9b7035-1361-4cf5-ab62-a68f0c2c147b","resolution":{"observed_at":"2026-05-15T01:55:12.732507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":"2401.15947","doi":"10.48550/arxiv:2401.15947","metadata_source":"pith","pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","venue":"cs.CV","work_id":"63cb47e5-f562-42d1-8877-63216e4c0af6","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:44e8e453915f373e0e8cac6c2027fc6cd3ab6747ff24fe02b4bc1d8de8144f50","observation_id":"7c4f82bd-232a-4ce2-9930-e2a40a6011cb","resolution":{"observed_at":"2026-05-16T02:33:30.459169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mi- crosoft coco: Common objects in context","venue":null,"work_id":"494b03a0-5285-41c3-8c77-6412b9d96c2a","year":2014},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:b159bf660d1d7d9ecea950de0fa62e5e6f3fbb8e4d8325a15fea932da5e88a18","observation_id":"ae981ab4-9564-4a22-b692-c3f0b5fc71df","resolution":{"observed_at":"2026-05-15T01:55:12.736464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GRES: Generalized referring expression segmentation","venue":null,"work_id":"e218b859-928e-48ec-bd9f-799b7736f729","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:c021b0bf60892fa9be9fc8125c9e31333e391d1e7875ebfaa4f58f716793830d","observation_id":"4cd61f70-2dbe-4925-a00c-1afc98be521d","resolution":{"observed_at":"2026-05-15T01:55:12.738341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SPHINX-x: Scaling data and parameters for a family of multi- modal large language models","venue":null,"work_id":"e330c377-9395-49a3-8b69-6af3e73dadd4","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:d45fc417e4a562c1bd020fb51860c93bf22ad8c7e204573ac107223b50689c88","observation_id":"b9c48908-59ac-48cb-9350-c02d431efc71","resolution":{"observed_at":"2026-05-15T01:55:12.740252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10774","last_updated":"2024-04-15T15:48:48Z","snapshot_observed_at":"2026-07-06T16:49:13.099946Z","submitted_at":"2023-11-15T23:36:42Z","title":"MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.10774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10774","snapshot_observed_at":"2026-06-29T07:33:13.933286Z","title":"Mmc: Advancing multimodal chart understand- ing with large-scale instruction tuning","venue":null,"work_id":"13b595a4-f812-4cd9-8181-84ac42e42893","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2311.10774","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:f66301b74770c85839c581a41a32a661c22c271a96e531a458b262b4e6b29af7","observation_id":"00907bf3-cd35-4657-b388-5e313e8e44d5","resolution":{"observed_at":"2026-05-15T01:55:12.656437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"884b6134-4d98-4687-b66c-f9b43a72d3b3","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:77d3cc53ec7404370315b8d2ca03cbac7aaee98d8cac07bfdb9e593d6d676794","observation_id":"a154ac9f-d09e-4fd9-b233-65d1d867ba7c","resolution":{"observed_at":"2026-05-15T01:55:12.743742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"b19f0c85-b60c-463e-830c-456289183de8","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:0f91553e43e22c896b0a09f90b3ec8b0d1e559b1a83afb579f633696d8a72d7e","observation_id":"259a9fae-5cc0-40ef-86d4-71f275b4b70d","resolution":{"observed_at":"2026-05-15T01:55:12.745606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge","venue":null,"work_id":"baa37af5-77a5-4346-8c4b-d3701770b5a9","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:baca4846323fabbe785fba3ac25d4713cfc856acd69423f2f6a17a76c79bbada","observation_id":"47de1e46-8e0d-4f37-8efe-49916253543d","resolution":{"observed_at":"2026-05-15T01:55:12.747825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":"1608.03983","doi":"10.21203/rs.3.rs-7055642/v1","metadata_source":"pith","pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","venue":"cs.LG","work_id":"ad476478-c5ea-495b-a454-168c504bbfcc","year":2016},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:06feebc5cb55bb2661b0ab2342b385bf4704ea0c6e4e6f384c164666e466eb8f","observation_id":"33474c40-71df-42f0-8198-39abc54cb99f","resolution":{"observed_at":"2026-05-15T01:55:12.659286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled weight decay regu- larization","venue":null,"work_id":"1e53f7e0-1fac-4c85-a8a9-967df49bdcc2","year":2019},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:ad59afc71c47979f5629afcb939ab8bc99a813695ec39cc9d3b4a3cbebf73708","observation_id":"7d8bb6a7-159b-4a39-bb7e-48ec9315cbf4","resolution":{"observed_at":"2026-05-15T01:55:12.751473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":"2403.05525","doi":"10.48550/arxiv.2403.05525","metadata_source":"pith","pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","venue":"cs.AI","work_id":"30da36a4-b9ad-4618-8955-c09232b61343","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:3ae1f255312ee9b94bb2858e2d87b1a7e3f9adc35b0859694745e64298b1cbda","observation_id":"81c71248-cc10-452a-9eae-4158779acee1","resolution":{"observed_at":"2026-05-15T01:55:12.662275Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":"24dbb572-05f6-4ed7-938c-3705c1d63c2b","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:ea4b27c2b529d03919f9d80a174cce83f5d9e68825d7441ec24397382cae7373","observation_id":"2e3ce511-9b32-4b58-b1c2-d783d8aa6441","resolution":{"observed_at":"2026-05-15T01:55:12.755069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn to explain: Multimodal reasoning via thought chains for sci- ence question answering","venue":null,"work_id":"24ffb832-ac5f-4ce9-97bb-a1f423943c77","year":2022},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:c8b4b0cadbd0dfe95887dcabe62adc45ba8913fcf1ee8fbdaccfa496202ffa99","observation_id":"d7bc6368-5151-44a8-aa86-f1930c8bc96c","resolution":{"observed_at":"2026-05-15T01:55:12.756941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dy- namic prompt learning via policy gradient for semi-structured math- ematical reasoning","venue":null,"work_id":"0b9abecf-a801-4c3a-b816-bc8909561b11","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:55d43f0cf05b892107aade3a7ef4c0a3c73e1352476101a4a4e2d93f68415b5b","observation_id":"a8b3a234-af38-4831-92ef-2a68e20ae143","resolution":{"observed_at":"2026-05-15T01:55:12.759195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MathVista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":"a7642410-03cf-48f2-a08a-15995aa49851","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:94db11a786c54b860f4064678cc6db3ed16298ad8928456d18128a4cecbbd27c","observation_id":"5d625152-6f44-4ac7-b117-d7fc2b6a6040","resolution":{"observed_at":"2026-05-15T01:55:12.761070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cheap and quick: Efficient vision-language in- struction tuning for large language models","venue":null,"work_id":"8025719b-cc3d-4118-a4a3-7e13102b8c73","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:c62502893ee10145147f4c6b2d8375e30e906a6974dfe723fa6413dddcea3cdd","observation_id":"55c7b206-57f1-43f5-a9d1-8e5377195d9d","resolution":{"observed_at":"2026-05-15T01:55:12.763583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07852","last_updated":"2024-04-02T01:07:05Z","snapshot_observed_at":"2026-07-31T01:56:30.416855Z","submitted_at":"2023-09-14T16:54:34Z","title":"ExpertQA: Expert-Curated Questions and Attributed Answers","version":2},"cited_work":{"arxiv_id":"2309.07852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.07852","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ExpertQA: Expert-curated questions and attributed answers","venue":null,"work_id":"2a1772bd-e88c-49c1-8396-ee6f952ee88c","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2309.07852","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:48ff854fee054899a035d9ebe555bf42558803950cd3c35a420e251d8d02c78b","observation_id":"9245dc91-9630-459b-b637-553008f44f89","resolution":{"observed_at":"2026-05-15T01:55:12.665306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OK-VQA: A visual question answering benchmark re- quiring external knowledge","venue":null,"work_id":"27e27d53-5162-4bd5-aa97-a91f5123f940","year":2019},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:f3f04ed198048e32b28115914b25ed06ce7db7f66a43b3988a0e6c478e9a4e3a","observation_id":"b5284158-b423-4a2f-b560-1280095a16aa","resolution":{"observed_at":"2026-05-15T01:55:12.767156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"4dddc240-fee2-48d4-8ac2-e63976986dfb","year":2022},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:d63df2dc4c75526b50ee2b9b7f046e0261ca1aacdd04b8102226b54b686bc202","observation_id":"957c4882-cb5c-40eb-8ecb-80e9b9472453","resolution":{"observed_at":"2026-05-15T01:55:12.769089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DocVQA: A dataset for VQA on document images","venue":null,"work_id":"4d0f828a-11cc-474c-b357-aab1797523d6","year":null},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:4658dc55823a5e53f31939b33e28f77c70ba995fe7fbf990c0832dc4df19bed3","observation_id":"bf158c1b-e9cc-4f3d-8506-32749ddfa62f","resolution":{"observed_at":"2026-05-15T01:55:12.771707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InfographicVQA","venue":null,"work_id":"44574df7-b43f-4801-8feb-693ee257071d","year":null},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:6ee120c46585134d1214bd2c1a0b06035b2080cef07db8bbba2bf5ee42876b0a","observation_id":"3dd108be-bf0c-4aa3-b9a1-4729fa220f9d","resolution":{"observed_at":"2026-05-15T01:55:12.773612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":"2403.09611","doi":"10.48550/arxiv.2403.09611","metadata_source":"pith","pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","venue":"cs.CV","work_id":"378a250e-75a3-4ceb-b9a3-f8a5c2ed1a66","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:11b53f7dfc93465a931308da4b29cdbf702a6ef5366c29a40b6eb592eef73cc8","observation_id":"db67f8a3-8083-40ea-b8f4-c41282c2bd7a","resolution":{"observed_at":"2026-05-16T04:09:36.761640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PlotQA: Reasoning over scientific plots","venue":null,"work_id":"486da674-a88e-4fa7-9da1-50e7ebcfd061","year":2020},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:093480a841db500439c516bc7a2ec39cbce7e43cc0a59507022f0b88c29332eb","observation_id":"fe9fa82c-70a6-4603-998d-e2ad55fb2439","resolution":{"observed_at":"2026-05-15T01:55:12.779430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02060","last_updated":"2025-03-03T01:25:46Z","snapshot_observed_at":"2026-07-29T16:11:06.082798Z","submitted_at":"2024-09-03T17:08:20Z","title":"OLMoE: Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":"2409.02060","doi":"10.48550/arxiv.2409.02060","metadata_source":"pith","pith_arxiv_id":"2409.02060","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OLMoE: Open Mixture-of-Experts Language Models","venue":"cs.CL","work_id":"91fa6600-4fda-4022-b2c7-205e8a242a49","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2409.02060","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:da9d17fe1efd5793076a5de4cd999d3115f027de14523b4367455058f904c05e","observation_id":"7e25d38f-c1c0-45d2-8339-650a94a7e581","resolution":{"observed_at":"2026-05-16T14:43:13.722529Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:1e212fcbdc085b721dd65e7caff0dde6ca3bc2edf6fed624c6b5dc06454bec06","observation_id":"ab04819f-78a2-43de-af8c-ee4b016baa7a","resolution":{"observed_at":"2026-05-15T01:55:12.673580Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPT-4o mini system card","venue":null,"work_id":"2581b16e-e0fd-45f4-aeb9-11c3d0854651","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:cea58ccb3b3fe417b927765ee67363c9140a76cba609e30bb722f93385400101","observation_id":"46f43994-70be-4b43-becc-ad381b784019","resolution":{"observed_at":"2026-05-15T01:55:12.796338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:f5d0c824b3e785b3d8e002ae45f81cd646982ebc4d101f554b5bdd5a6bb7ace2","observation_id":"7d7e216d-8211-46a2-bbbb-d199f3f7dd8a","resolution":{"observed_at":"2026-05-15T01:55:12.676404Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:4a9dafae153762f962c33ca413c82f18c5a5c52cd2e457c7dc476871d960ecac","observation_id":"e13f6784-27fc-4f31-a098-5fce1a425133","resolution":{"observed_at":"2026-05-15T01:55:12.679057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":"2306.14824","doi":"10.48550/arxiv.2306.14824","metadata_source":"pith","pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","venue":"cs.CL","work_id":"46e7f9e9-24c6-49af-b7d5-96159fa6f443","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:c7447464ee7db479ee88ec5b2f6adbbefc83ee6b319ad23aa12ffb5b52533da6","observation_id":"0b673372-18ef-4d2c-ac6e-5f632337b2b9","resolution":{"observed_at":"2026-05-15T01:55:12.681581Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Connecting vision and language with lo- calized narratives","venue":null,"work_id":"3295b585-8cd4-4efb-9089-3c4b3db7a2c3","year":2020},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:4b4f84b07ba65a54ccb6ff21d8724e1330e1c0afbc8de9a12d9d77defa7739e2","observation_id":"f7b0621a-0b12-4e6a-945b-0833c445c289","resolution":{"observed_at":"2026-05-15T01:55:12.803801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jack of all tasks, master of many: Designing general- purpose coarse-to-fine vision-language model","venue":null,"work_id":"ef8e09d6-4de2-436f-9410-4a3aedfdf65d","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:4e928ec2bab91f6b086a315aacb148ca7f52b6fa5138eb362718eff3c45c0f66","observation_id":"eac89216-e82d-4cc1-bfbe-f2966e4a05f8","resolution":{"observed_at":"2026-05-15T01:55:12.806020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving language understanding by generative pre- training","venue":null,"work_id":"b4d206ee-fc4f-4739-9931-34230bf82381","year":2018},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:7bdb1ddda620f4e0fc3f3ef40599aedb1001ca81f162ec67aaa43447cb48add2","observation_id":"f24fbc4b-1c53-4e5e-9523-7b9dcdbd4951","resolution":{"observed_at":"2026-05-15T01:55:12.807886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"28 Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"25a49f03-dd85-4147-9646-9e7954f3739d","year":2021},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:881af1e403fc7d1dc8d21c68c23cf3f16d965bd09a09f84b56bbcd1d43663935","observation_id":"1472ef67-4680-49b7-a62a-ec13abb25d32","resolution":{"observed_at":"2026-05-15T01:55:12.813303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GLaMM: Pixel grounding large multimodal model","venue":null,"work_id":"460e4785-d532-4638-80c5-3eef960fe5ff","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:5c8d33e6449362bffecdb0da0f536fb4884a63d517fa7709fdf64eb520cb8f96","observation_id":"8b170e06-f38b-4061-a0ed-ea4481ae3150","resolution":{"observed_at":"2026-05-15T01:55:12.815073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-07-29T21:51:47.064287Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"cited_work":{"arxiv_id":"2210.08402","doi":"10.48550/arxiv.2210.08402","metadata_source":"pith","pith_arxiv_id":"2210.08402","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","venue":"cs.CV","work_id":"1d19deb4-3043-409d-b901-f047c51a323b","year":2022},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2210.08402","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:cadc633d467479dc1414984efe2a244017d79120e200c9bf745385169f018b28","observation_id":"e717be9b-542a-4e2a-a2b6-0b48076ffc46","resolution":{"observed_at":"2026-05-15T01:55:12.684621Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A-OKVQA: A benchmark for vi- sual question answering using world knowledge","venue":null,"work_id":"3e097ed4-b7c6-442f-9eaa-d6d5e8c8d855","year":2022},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:4d8b24acfc7b198ca9f5ec49f759daf84148e2b9efa51ec98bc6d84b8bd646c4","observation_id":"1d538a46-71da-429e-bd0c-eee4f3fb3589","resolution":{"observed_at":"2026-05-15T01:55:12.823262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards VQA models that can read","venue":null,"work_id":"b146c03b-1bba-4cb1-83e7-29df32e95cad","year":2019},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:7cdb0072aa24b61f5d24b785c0bf23cc57a2fc8d5adeba37d777a6aea37d3784","observation_id":"b8dae70c-7937-498b-a12e-bfb158ab969e","resolution":{"observed_at":"2026-05-15T01:55:12.829132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":2,"verified_exact":39,"verified_fuzzy":55},"total_outbound_references":137},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 137 outbound references and 80 inbound Pith citation observations for arXiv:2409.17146."}