{"as_of":"2026-08-17T17:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:76c208235e3699548fe40ba50a359b8fff08dfdff8d4295a447a2f0049ce0553","coverage":[{"denominator":113,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:24:08.529010Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T17:09:33.968186Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T19:06:10.238711Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"cited_work":{"arxiv_id":"2508.12680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12680","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision-g1: Towards general vision language reasoning with multi-domain data curation","venue":null,"work_id":"f445abf3-2db0-4473-9327-70197a41d3f1","year":2025},"citing_paper":{"arxiv_id":"2604.08539","last_updated":"2026-04-19T05:24:16Z","snapshot_observed_at":"2026-08-14T16:19:44.882122Z","submitted_at":"2026-04-09T17:59:39Z","title":"OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T17:09:33.968186Z"},"links":{"cited_paper":"/paper/2508.12680","citing_paper":"/paper/2604.08539"},"observation_digest":"sha256:1b846b03ba62488cbd2b9d33df6b5231e6a3b7c79f3445232e661d37d996a8aa","observation_id":"6bf98c01-7ddf-4da9-888a-95077f7dad34","resolution":{"observed_at":"2026-05-11T07:30:58.744656Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"cited_work":{"arxiv_id":"2508.12680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12680","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision-g1: Towards general vision language reasoning with multi-domain data curation","venue":null,"work_id":"f445abf3-2db0-4473-9327-70197a41d3f1","year":2025},"citing_paper":{"arxiv_id":"2604.20806","last_updated":"2026-04-22T17:37:40Z","snapshot_observed_at":"2026-08-15T14:01:34.813286Z","submitted_at":"2026-04-22T17:37:40Z","title":"OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T00:40:47.562861Z"},"links":{"cited_paper":"/paper/2508.12680","citing_paper":"/paper/2604.20806"},"observation_digest":"sha256:f9440b4f3147866091c0a041c6f234c6df6835598ca184412be9d0e75a0d8293","observation_id":"27a7c529-19a8-4113-909d-20fb608e0500","resolution":{"observed_at":"2026-05-11T13:46:03.296681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"cited_work":{"arxiv_id":"2508.12680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12680","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision-g1: Towards general vision language reasoning with multi-domain data curation","venue":null,"work_id":"f445abf3-2db0-4473-9327-70197a41d3f1","year":2025},"citing_paper":{"arxiv_id":"2604.22192","last_updated":"2026-06-09T07:14:26Z","snapshot_observed_at":"2026-08-14T18:32:30.373064Z","submitted_at":"2026-04-24T03:39:51Z","title":"CharTide: Data-Centric Chart-to-Code Generation via Tri-Perspective Tuning and Inquiry-Driven Evolution","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-08T12:40:34.424341Z"},"links":{"cited_paper":"/paper/2508.12680","citing_paper":"/paper/2604.22192"},"observation_digest":"sha256:687d399ad06938d75aab3003a8c39d467ad353947a5b827bfd07ed5695779f99","observation_id":"f3d80314-5b0f-4b0b-bdf7-8e8705610c62","resolution":{"observed_at":"2026-05-11T19:06:10.242064Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"cited_work":{"arxiv_id":"2508.12680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12680","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision-g1: Towards general vision language reasoning with multi-domain data curation","venue":null,"work_id":"f445abf3-2db0-4473-9327-70197a41d3f1","year":2025},"citing_paper":{"arxiv_id":"2605.06121","last_updated":"2026-05-07T12:30:02Z","snapshot_observed_at":"2026-08-15T19:14:13.053468Z","submitted_at":"2026-05-07T12:30:02Z","title":"Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T14:02:29.480442Z"},"links":{"cited_paper":"/paper/2508.12680","citing_paper":"/paper/2605.06121"},"observation_digest":"sha256:7f4710e590e1dcdde0a2b84bde3a9043859c1a09978732b16da7c90a36c385a9","observation_id":"f4626655-0973-4564-9de3-00cec701f71f","resolution":{"observed_at":"2026-05-11T18:46:09.398205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.12680/citation-record","integrity":"/paper/2508.12680/integrity","json":"/paper/2508.12680/citation-record.json","paper":"/paper/2508.12680"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T17:24:08.025253Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.025253Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:6a43d825abae177de7d8c4422caef8ee028c9235b18d40e58d2d50a6f4d78192","observation_id":"cfd5f7f5-cedb-4235-b24c-3b2b79e6a404","resolution":{"observed_at":"2026-08-15T17:24:08.025253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T17:24:08.031605Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.031605Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:0891f88f3c91e438891f7976d739fd396cc224fcc408400b919b326da1593f20","observation_id":"ce8eff9e-56fc-4499-ad9d-9ffb88505115","resolution":{"observed_at":"2026-08-15T17:24:08.031605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.037031Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.037031Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:9e3d74856047589705fb556bc6989bf9f49df497b398b29e9e66dd07cb3a589c","observation_id":"6aa7cf1a-2207-493e-b21f-e67f780a5272","resolution":{"observed_at":"2026-08-15T17:24:08.037031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.042129Z","title":"SWE-bench: Can language models resolve real-world github issues? In The Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.042129Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:56336823d1869881c966d395b30c8478774ea46d28ed69231ea39eaa1b6d6be7","observation_id":"4a2cf671-3e03-4208-86e5-e1bf28c41528","resolution":{"observed_at":"2026-08-15T17:24:08.042129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.047280Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.047280Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:97d61f05e6069c27b71424c792fdc5e512a7f4fb1890ae20891f3533a3b45d97","observation_id":"5aea5da8-1175-4b5c-a206-e8dae25642b7","resolution":{"observed_at":"2026-08-15T17:24:08.047280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-15T17:24:08.052248Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.052248Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:a3844419bd463a05d1e32b8022993e4613153b66e4ab8da02bd25209ffc9680c","observation_id":"c00739b9-2aff-4843-bf97-9b9bc98461f3","resolution":{"observed_at":"2026-08-15T17:24:08.052248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-15T17:24:08.057500Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.057500Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:53348d3f19106c3a3de374aa2b0284f2d3d0ace3f3d8ca8d6de64cb24f2430b6","observation_id":"464d6984-42b7-43e7-980b-ed5dd2d088d2","resolution":{"observed_at":"2026-08-15T17:24:08.057500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-17T06:16:58.781932Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14965","snapshot_observed_at":"2026-08-15T17:24:08.063540Z","title":"Revisiting reinforcement learning for llm reasoning from a cross-domain perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.063540Z"},"links":{"cited_paper":"/paper/2506.14965","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:04db5fc9c30542620e978a0b6a623f43127945ee1b288916125daa93740cc21e","observation_id":"ade186c9-82a5-49a8-be9f-a10ccce1f593","resolution":{"observed_at":"2026-08-15T17:24:08.063540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T17:24:08.069223Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.069223Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:78071089cbfb8d7535a82b6ee8ffa5a134d0307a6044d5493c6593dafd9e8ecf","observation_id":"fe4eab4d-e348-4dd7-85bd-740000ab12f2","resolution":{"observed_at":"2026-08-15T17:24:08.069223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.075537Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.075537Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:7c23ba7f745b58d3b49d318410c250065716b3e163293edd3ce8cad059f1db8a","observation_id":"ff11dbdd-89e4-4039-b08e-30fd1a15485f","resolution":{"observed_at":"2026-08-15T17:24:08.075537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.080483Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.080483Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:731feba41e19ae96184acd2e5c9c59ab029bf0b5df7c9a6dc71eff3b6f9aaec7","observation_id":"b335f2bc-d348-4448-9e50-7861a3efc2c7","resolution":{"observed_at":"2026-08-15T17:24:08.080483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-14T21:12:00.450049Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-15T17:24:08.085320Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.085320Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:d3385bd9bc6fc406c383bfd3908c88a28bdc8d0ac7c2f86dd648cd0c43ebbf2a","observation_id":"58da3d48-c780-4ecd-ab43-50f69b2a6eb4","resolution":{"observed_at":"2026-08-15T17:24:08.085320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.090540Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.090540Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:dd07ed01fa8aae683c5f70fac30f93bd5ae828b0380145ea7840f9f1f27ef022","observation_id":"bbcb08f5-158d-40db-98bc-4747335ee78a","resolution":{"observed_at":"2026-08-15T17:24:08.090540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.095874Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.095874Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:29b1aabd019b4904da41bdf996ff22c3e863eaca110eb543404e3d493467c107","observation_id":"3bde4210-ac89-43db-a1de-bf6ee3940371","resolution":{"observed_at":"2026-08-15T17:24:08.095874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01904","last_updated":"2025-02-05T09:17:01Z","snapshot_observed_at":"2026-08-16T12:59:45.562292Z","submitted_at":"2025-01-03T17:14:16Z","title":"Virgo: A Preliminary Exploration on Reproducing o1-like MLLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01904","snapshot_observed_at":"2026-08-15T17:24:08.105506Z","title":"Virgo: A preliminary exploration on reproducing o1-like mllm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.105506Z"},"links":{"cited_paper":"/paper/2501.01904","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:a7d145be7a74ca4faed3e6b33df1dcf8c06b8484627c8dba803be029f6c01717","observation_id":"7622440a-edb0-41fd-b314-135e30cbaa0c","resolution":{"observed_at":"2026-08-15T17:24:08.105506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-15T09:44:57.157415Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-15T17:24:08.110787Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.110787Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:81b749629c356ec3070f1c80b88633e0cd364e94584f97c5f9d05510c3733065","observation_id":"112b9614-e7a1-4a83-8c93-a72286806a15","resolution":{"observed_at":"2026-08-15T17:24:08.110787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-16T23:37:49.144529Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-15T17:24:08.116175Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.116175Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:b417dc3b4fea6958c878fe261376fe40b95db02a18e7f9207c237663b3bac389","observation_id":"e23391ff-c8d4-463f-a79c-78f2522cadd0","resolution":{"observed_at":"2026-08-15T17:24:08.116175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-16T02:03:48.252223Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-15T17:24:08.121024Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.121024Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:d5d34ba7083bd760d055fe096904ba7644797a5ee72575bb16025d216fa2d956","observation_id":"6e8cb2c6-8893-4d19-ae6a-e7dba4b1234a","resolution":{"observed_at":"2026-08-15T17:24:08.121024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07934","last_updated":"2025-05-30T15:53:16Z","snapshot_observed_at":"2026-08-16T12:42:16.823929Z","submitted_at":"2025-04-10T17:49:05Z","title":"SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07934","snapshot_observed_at":"2026-08-15T17:24:08.125709Z","title":"Sota with less: Mcts-guided sample selection for data-efficient visual reasoning self-improvement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.125709Z"},"links":{"cited_paper":"/paper/2504.07934","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:f82efbefdd10a0b8883e06096407014aa673a06145fba69377183dd661128bd4","observation_id":"642c9b11-9ea2-4095-8624-faaa2e2aafde","resolution":{"observed_at":"2026-08-15T17:24:08.125709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-08-17T11:15:45.055944Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-15T17:24:08.130682Z","title":"Vl- rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.130682Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:c9973f8f7eeb2bafbe1521ed3589ccbd6665d6c84326221ccefdb898ba6ab07e","observation_id":"90239c86-c51a-4bc9-a116-367c475a62c1","resolution":{"observed_at":"2026-08-15T17:24:08.130682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-17T03:46:28.942551Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-15T17:24:08.135546Z","title":"Kimi-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.135546Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:07c19f808552bcebcd4f44bf16f5b203186b2b95135e1988d28d794b9ec63078","observation_id":"0544f2a6-a603-43a8-804b-37d51e1ee67e","resolution":{"observed_at":"2026-08-15T17:24:08.135546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.140526Z","title":"Improve vision language model chain-of-thought reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.140526Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:560f1b3d94bcbbb28813ea2b62317af53b829e6d88808bea1f2e162151d4e614","observation_id":"2af91df2-18d5-4b30-88f3-717e80af052b","resolution":{"observed_at":"2026-08-15T17:24:08.140526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.145289Z","title":"Llava-cot: Let vision language models reason step-by-step, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.145289Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:246d64797f21f403bec11edb10c6b550a1f0a6f86e3379b300277b3e817e58ca","observation_id":"643b81b0-db47-446e-84f0-a9d29287b31c","resolution":{"observed_at":"2026-08-15T17:24:08.145289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.150221Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.150221Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:194b1869f755e645e83c9f29f3065afc83e25395e862578d2c4bc08ce8e333d1","observation_id":"d2394a16-e466-42f0-a81e-1ad9d082294d","resolution":{"observed_at":"2026-08-15T17:24:08.150221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24164","snapshot_observed_at":"2026-08-15T17:24:08.154904Z","title":"Mixed-r1: Unified reward perspective for reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.154904Z"},"links":{"cited_paper":"/paper/2505.24164","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:a25bdd0edbbb0f44515d926adde79493adc30c4681c9cdab8413d96ebd2ebf48","observation_id":"d2cec0f4-2c7c-45ac-8c25-2662a84eb841","resolution":{"observed_at":"2026-08-15T17:24:08.154904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-14T12:50:25.203482Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24871","snapshot_observed_at":"2026-08-15T17:24:08.160749Z","title":"Modomodo: Multi-domain data mixtures for multimodal llm reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.160749Z"},"links":{"cited_paper":"/paper/2505.24871","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:195f3e31f914a97abba35ab53e43f5b40c43f0fb923c69260210dd1a004968e8","observation_id":"da7e05ac-18da-4499-9480-2d1f810a8482","resolution":{"observed_at":"2026-08-15T17:24:08.160749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04333","last_updated":"2024-06-13T03:42:02Z","snapshot_observed_at":"2026-08-16T14:20:52.583862Z","submitted_at":"2024-02-06T19:18:04Z","title":"LESS: Selecting Influential Data for Targeted Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04333","snapshot_observed_at":"2026-08-15T17:24:08.165737Z","title":"Less: Selecting influential data for targeted instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.165737Z"},"links":{"cited_paper":"/paper/2402.04333","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:8966d5cbe50da3cd1e5b34c95bdd1c880da63d1928ff626e0556d10d04994f56","observation_id":"17e8a213-d68d-4a21-b5bd-71b06b1fe91a","resolution":{"observed_at":"2026-08-15T17:24:08.165737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08484","last_updated":"2020-11-14T18:47:35Z","snapshot_observed_at":"2026-08-17T13:05:26.793779Z","submitted_at":"2020-02-19T22:40:32Z","title":"Estimating Training Data Influence by Tracing Gradient Descent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08484","snapshot_observed_at":"2026-08-15T17:24:08.170718Z","title":"Estimating training data influence by tracking gradient descent","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.170718Z"},"links":{"cited_paper":"/paper/2002.08484","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:1dc6ed456b81e6b213a427f384b1643bed94158f3b9a91b475ee6683da022622","observation_id":"183598ef-8a3e-482c-8f50-d146f36bd236","resolution":{"observed_at":"2026-08-15T17:24:08.170718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.175673Z","title":"GPT-4o System Card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.175673Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:65b4128d82ae4f2ea53ff75ac61e77fe2dff0abd6987d36bd17a9fd913dca9ce","observation_id":"fb1a6e3f-3679-4b9f-a601-dedf248447a8","resolution":{"observed_at":"2026-08-15T17:24:08.175673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-15T17:00:20.282987Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-15T17:24:08.180238Z","title":"Llava-o1: Let vision language models reason step-by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.180238Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:42262e265896db8e49175d20ae8abb21e311250d74c7d15ba37cb5e56635e792","observation_id":"606f5ab8-6bd8-415b-aa7a-9850ede75773","resolution":{"observed_at":"2026-08-15T17:24:08.180238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-15T17:24:08.185246Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.185246Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:9a67c38ca15e2ee66744fb27ddf25730d942662bc9391ce1692f7f735467b992","observation_id":"6251beb0-6008-4404-8d7a-7d8c47d1a376","resolution":{"observed_at":"2026-08-15T17:24:08.185246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.190465Z","title":"Qvq: To see the world with wisdom, December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.190465Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:385fb255cdb607ff1666201e08f98357a700fe86d32cdde71dda5f571c1c1d36","observation_id":"a7eb8a0b-c7b5-4ad2-950d-304f8a234132","resolution":{"observed_at":"2026-08-15T17:24:08.190465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-15T17:24:08.195348Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.195348Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:8eb94b466351523cd59070f210f36ee5c1596533cb38e9dd98fe461b17d99a5b","observation_id":"68b71451-4a7a-4856-86ba-b191f7adc41a","resolution":{"observed_at":"2026-08-15T17:24:08.195348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T17:24:08.200230Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.200230Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:5eae58fc3c616b03f5774d8eae0ddda6a98f9e6f47c4f8aa725e40aa46707b0f","observation_id":"f24ef1ec-9434-4f03-a185-96858763d27b","resolution":{"observed_at":"2026-08-15T17:24:08.200230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.205225Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.205225Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:94f0a22541618345b95a7dd44a60afe0f262be7bd1f95ffbffe7a08d4d7c0ef5","observation_id":"88f412a1-b5a5-45f7-a2bf-78a6b741fa94","resolution":{"observed_at":"2026-08-15T17:24:08.205225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.210995Z","title":"R1-v: Reinforcing super gen- eralization ability in vision-language models with less than $3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.210995Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:7908227ca95ea26b7087522a88113bf07d29928a5f34164b29cf61fb6b348805","observation_id":"5d4b8d6e-260a-49aa-9a78-6e1471136246","resolution":{"observed_at":"2026-08-15T17:24:08.210995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-16T22:33:00.173650Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-15T17:24:08.215793Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision- language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.215793Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:8ee7746acff5b6595cb38fcff91e6fde23aaeab55f4917e6bb70ce7b8cd70c25","observation_id":"a3c2899c-091c-4675-aa56-5eb2bec22a5b","resolution":{"observed_at":"2026-08-15T17:24:08.215793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.220934Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.220934Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:be470b855cf970d4cd42b1d09aaea59f60e5b441ea6b83529de69cabed7e729e","observation_id":"fbd8b0af-21e1-4a8c-9841-09f1b4e70411","resolution":{"observed_at":"2026-08-15T17:24:08.220934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.225981Z","title":"Lima: Less is more for alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.225981Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:fb9b3f1260eec397902cbaad4d99b8a8506ef0b23317fe3c2d2ec64db0e1e9d7","observation_id":"cc2396e8-cd50-45ba-8cd9-3706eac66bb3","resolution":{"observed_at":"2026-08-15T17:24:08.225981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09246","last_updated":"2023-05-16T07:52:57Z","snapshot_observed_at":"2026-08-16T15:32:45.917375Z","submitted_at":"2023-05-16T07:52:57Z","title":"Maybe Only 0.5% Data is Needed: A Preliminary Exploration of Low Training Data Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09246","snapshot_observed_at":"2026-08-15T17:24:08.231109Z","title":"Maybe only 0.5% data is needed: A preliminary exploration of low training data instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.231109Z"},"links":{"cited_paper":"/paper/2305.09246","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:addfb77977a3b4896192e99afef26da8da622cae7e2c1b963da72483818cea36","observation_id":"f35c73f3-39d1-45fb-807c-6ba3f365470f","resolution":{"observed_at":"2026-08-15T17:24:08.231109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14904","last_updated":"2023-11-25T02:45:50Z","snapshot_observed_at":"2026-08-16T14:40:30.491068Z","submitted_at":"2023-11-25T02:45:50Z","title":"LLM-Assisted Code Cleaning For Training Accurate Code Generators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14904","snapshot_observed_at":"2026-08-15T17:24:08.236832Z","title":"Llm-assisted code cleaning for training accurate code generators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.236832Z"},"links":{"cited_paper":"/paper/2311.14904","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:bd730bf6750a740f95fd3f2bf4fb57b190bdf28f9f01e83343dac763732fecba","observation_id":"12946d17-c9d3-47d6-b083-e47acee5baef","resolution":{"observed_at":"2026-08-15T17:24:08.236832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15685","last_updated":"2024-04-16T02:46:58Z","snapshot_observed_at":"2026-08-16T14:31:46.566838Z","submitted_at":"2023-12-25T10:29:28Z","title":"What Makes Good Data for Alignment? A Comprehensive Study of Automatic Data Selection in Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15685","snapshot_observed_at":"2026-08-15T17:24:08.242672Z","title":"What makes good data for alignment? a comprehensive study of automatic data selection in instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.242672Z"},"links":{"cited_paper":"/paper/2312.15685","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:8d75241f641820f813b0af38ff59c4803c6961b5cd42663a165bc2df2875f374","observation_id":"c6e8cc79-7e3c-4088-a071-b849fad1b69e","resolution":{"observed_at":"2026-08-15T17:24:08.242672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00788","last_updated":"2024-01-01T15:30:19Z","snapshot_observed_at":"2026-08-16T14:30:29.004078Z","submitted_at":"2024-01-01T15:30:19Z","title":"Astraios: Parameter-Efficient Instruction Tuning Code Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00788","snapshot_observed_at":"2026-08-15T17:24:08.247730Z","title":"Astraios: Parameter-efficient instruction tuning code large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.247730Z"},"links":{"cited_paper":"/paper/2401.00788","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:a24827e78c235cc9d79d8f3b0da437d2010e31e18ca5eacae5f970b9153cbfd2","observation_id":"c73c9da2-a9c0-46e3-a726-cbb2d4663d9a","resolution":{"observed_at":"2026-08-15T17:24:08.247730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07124","last_updated":"2024-02-18T09:46:06Z","snapshot_observed_at":"2026-08-16T15:08:39.154570Z","submitted_at":"2023-08-14T13:53:54Z","title":"OctoPack: Instruction Tuning Code Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07124","snapshot_observed_at":"2026-08-15T17:24:08.252677Z","title":"Octopack: Instruc- tion tuning code large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.252677Z"},"links":{"cited_paper":"/paper/2308.07124","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:80b616b3d551d346225739f1b59f8b89438ae649995146933b856dbc9852cce1","observation_id":"0cb1384e-8139-4298-8508-cca5bcef0348","resolution":{"observed_at":"2026-08-15T17:24:08.252677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.257664Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.257664Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:23826e9d64c7feb1088c7eafcd9f67b1cb1ef97ab2caeae211719c88f96626d9","observation_id":"30a91729-8420-44bf-8e9b-39f6759bcbb0","resolution":{"observed_at":"2026-08-15T17:24:08.257664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.262872Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.262872Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:0853196b7d3eddab068fc4cf404c5ba5b0a8456e758123df27fbf0b391d4af24","observation_id":"acb0228c-59ed-4336-bbd5-7f6fc4c76ada","resolution":{"observed_at":"2026-08-15T17:24:08.262872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.267817Z","title":"Mmmu: A massive multi-discipline multi- modal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.267817Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:749c47a9e1157ab0d46e4373d003f3f6e4bd93a35b72614dd6bdf3b96de8886f","observation_id":"d4d2e983-fcd9-4d5b-808c-e86268208079","resolution":{"observed_at":"2026-08-15T17:24:08.267817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-15T17:24:08.272810Z","title":"Mmmu-pro: A more robust multi-discipline multimodal understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.272810Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:7fb47a86ce60617a99c1c850a667cb174bbe28358f362c3812190a2c9a5eab81","observation_id":"46cf7362-e5d1-46a6-bb99-4f1ba45e377c","resolution":{"observed_at":"2026-08-15T17:24:08.272810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-15T17:24:08.277999Z","title":"Are we on the right way for evaluating large vision- language models? arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.277999Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:860b541f382ede122a482730dab46b98c6db2fa23ee08ed6704144d10ab89c57","observation_id":"c5f39aea-717f-4e37-9215-6e84e5962235","resolution":{"observed_at":"2026-08-15T17:24:08.277999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-15T17:24:08.283136Z","title":"Logicvista: Multimodal llm logical reasoning benchmark in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.283136Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:982c7f380105343dc1068622bd370cb018934c5bed1399497fea87a425068342","observation_id":"75c08491-55e3-47da-af83-9fb8f069cbc3","resolution":{"observed_at":"2026-08-15T17:24:08.283136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.288087Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.288087Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:7245fcbb72883f51e135a31cc16f7fafa14b9fb837256e3f59a86e264db1bcab","observation_id":"b9656623-4767-4186-94f5-b2ae1fea1b86","resolution":{"observed_at":"2026-08-15T17:24:08.288087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.292710Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.292710Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:7eb792c6d4da9dd614fb8b13d63896ccfcf16e071ef86707424f6be1fa9083a8","observation_id":"697d2f21-c6f5-45bb-b7ca-7fd28bfbefa6","resolution":{"observed_at":"2026-08-15T17:24:08.292710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.297641Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.297641Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:7881bcfd58e9d66edd161e9004eba3cb1c31ca86b71f13259dd182072f4d9b4a","observation_id":"065bef9b-408c-473e-ac24-3904ed4f939e","resolution":{"observed_at":"2026-08-15T17:24:08.297641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-15T17:24:08.302455Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.302455Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:11f088b57a7cbf86ba68ced9854312b83aeb280e52d41d1766e07b3ef3ca4344","observation_id":"16a605b8-022a-4945-9fd4-0bc8dbb33625","resolution":{"observed_at":"2026-08-15T17:24:08.302455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-08-12T06:11:26.786967Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-15T17:24:08.307694Z","title":"We-math: Does your large multi- modal model achieve human-like mathematical reasoning? arXiv preprint arXiv:2407.01284, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.307694Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:0c0ff6ebea23593f2cb32696d0a1d5554972059270bdafa474433c17d9ab9618","observation_id":"659a2e93-4df8-4d7d-9d13-5bcad45354f1","resolution":{"observed_at":"2026-08-15T17:24:08.307694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00836","last_updated":"2025-02-24T06:55:22Z","snapshot_observed_at":"2026-08-16T13:04:52.250937Z","submitted_at":"2024-10-29T17:29:19Z","title":"DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00836","snapshot_observed_at":"2026-08-15T17:24:08.313024Z","title":"Dynamath: A dynamic visual benchmark for evaluating mathematical reasoning robustness of vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.313024Z"},"links":{"cited_paper":"/paper/2411.00836","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:d1365bf9d05b13c047cfa8bf4a5def64ec13da3d6af840aa5025b71b0c58b18b","observation_id":"ab350932-1d83-4672-a1b2-6435f145c084","resolution":{"observed_at":"2026-08-15T17:24:08.313024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.318268Z","title":"Charxiv: Charting gaps in realistic chart understanding in multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.318268Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:5e9e7c6978352de3c27f51334df23b1ec3220e5d5e2f870ce00904415b8ddc8d","observation_id":"2a673b41-5ccf-4fb4-8a99-b9d678df3c72","resolution":{"observed_at":"2026-08-15T17:24:08.318268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05506","last_updated":"2025-04-10T14:10:05Z","snapshot_observed_at":"2026-08-16T12:43:13.447310Z","submitted_at":"2025-04-07T21:05:06Z","title":"ChartQAPro: A More Diverse and Challenging Benchmark for Chart Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05506","snapshot_observed_at":"2026-08-15T17:24:08.322949Z","title":"Chartqapro: A more diverse and challenging benchmark for chart question answering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.322949Z"},"links":{"cited_paper":"/paper/2504.05506","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:f32ef969f528a2bc1c7da30fb538eb5d3267091db53c1de3d1ca54597f75a273","observation_id":"bd9394ee-27c1-4d83-ad73-20f2d6ae886d","resolution":{"observed_at":"2026-08-15T17:24:08.322949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.327988Z","title":"A dataset of clinically generated visual questions and answers about radiology images","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.327988Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:1967addc0abb1ceb35bb43960bf03c438b2ea335a4d71e5f4234a1ff767e3431","observation_id":"72bfa829-d95b-4eb4-abd1-7d58dce836d3","resolution":{"observed_at":"2026-08-15T17:24:08.327988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.10286","last_updated":"2020-03-07T17:55:41Z","snapshot_observed_at":"2026-07-06T09:06:42.071993Z","submitted_at":"2020-03-07T17:55:41Z","title":"PathVQA: 30000+ Questions for Medical Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.10286","snapshot_observed_at":"2026-08-15T17:24:08.332746Z","title":"Pathvqa: 30000+ questions for medical visual question answering","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.332746Z"},"links":{"cited_paper":"/paper/2003.10286","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:0de789fe53bb2b07ddb59cf35c75cd4305dc7efa973169904c132dc7350437c9","observation_id":"f841676b-ba39-40c1-b25e-5ffa31b25379","resolution":{"observed_at":"2026-08-15T17:24:08.332746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.337699Z","title":"Slake: A semantically- labeled knowledge-enhanced dataset for medical visual question answering","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.337699Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:4c781f80d338ac4f1ea5b1629f2653cd6cbd83f19438062f09635b706d685a3d","observation_id":"4a3f783a-95aa-4417-97e9-298d15cbc6f2","resolution":{"observed_at":"2026-08-15T17:24:08.337699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-16T18:06:01.131900Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-08-15T17:24:08.342648Z","title":"Muirbench: A comprehensive benchmark for robust multi-image understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.342648Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:39e62bc4dbab920928added59b4ff69d7e50e17c8fc8a4a4ccf1a001f7747b12","observation_id":"ff7cb12c-657c-4e22-8879-62ac8b89aca1","resolution":{"observed_at":"2026-08-15T17:24:08.342648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-15T17:24:08.347677Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.347677Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:792d58f84f27043d4a9497e121b4bf9c46b04769dc8a8706c1c7fd8f4e464448","observation_id":"72f64ce5-8e37-4f3a-b84e-f3d780d1ae00","resolution":{"observed_at":"2026-08-15T17:24:08.347677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-15T17:24:08.352870Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.352870Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:cb31cc4debfcdaacb08cde05a7d16f83ce443075603d9b6ab103397b08c36899","observation_id":"da29709f-a27e-4bc2-b702-7e3df9903af3","resolution":{"observed_at":"2026-08-15T17:24:08.352870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-15T17:24:08.357697Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.357697Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:c5744f019a61948fbe0a8521a92e392f9b9730538b4aa52db54ef3ff403b5634","observation_id":"34ae2762-e1ed-41ae-8ea5-71819f1e94ae","resolution":{"observed_at":"2026-08-15T17:24:08.357697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.362835Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.362835Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:440ff86f047647b5b793330aa1d65def859062aaf73461b52b6af50012ba1056","observation_id":"f10e8a88-ecf0-443e-9358-9d7289054b12","resolution":{"observed_at":"2026-08-15T17:24:08.362835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-13T20:16:31.803514Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-15T17:24:08.368349Z","title":"Mm-eureka: Exploring visual aha moment with rule-based large-scale reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.368349Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:cfad54403525d7f93b5637193cb9ad4695d6d07c6883823919445e296741da06","observation_id":"65c6103f-3e1b-40b1-8d0f-fd6070afde1c","resolution":{"observed_at":"2026-08-15T17:24:08.368349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-15T17:24:08.373195Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.373195Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:4b746332d2b4fd2eebde67640d98cbf317a76ec5207205d3faaeb9e42fa5dd48","observation_id":"0e724969-432f-4218-8cb3-d931bb78a8dd","resolution":{"observed_at":"2026-08-15T17:24:08.373195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T17:24:08.378185Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.378185Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:1f025dc93cc318c2c41c37513d3fbc4380a18c44272c2add3fbf3d8d6d876750","observation_id":"c6bf0777-e8da-4546-96d7-41539bd2234a","resolution":{"observed_at":"2026-08-15T17:24:08.378185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.07300","last_updated":"2018-02-22T22:50:42Z","snapshot_observed_at":"2026-08-15T22:53:17.165603Z","submitted_at":"2017-10-19T18:01:38Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.07300","snapshot_observed_at":"2026-08-15T17:24:08.382930Z","title":"Figureqa: An annotated figure dataset for visual reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.382930Z"},"links":{"cited_paper":"/paper/1710.07300","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:b7760c3830691e827db40f64104bfcc13f8c5c3b0a25e81b625440969d62ae33","observation_id":"376bacae-793c-42dd-9047-57ab352cf7a8","resolution":{"observed_at":"2026-08-15T17:24:08.382930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.387919Z","title":"Dvqa: Understanding data visualizations via question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.387919Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:5feea1165aea3cc4bd1e81e15a136e024fae81ddd3de549aa01ad9457816c743","observation_id":"63c1af2b-ad80-420f-97f4-2035f9b86daa","resolution":{"observed_at":"2026-08-15T17:24:08.387919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.392660Z","title":"Plotqa: Reasoning over scientific plots","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.392660Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:243cb9cf6f909dc1a71647d2086e4821f8193fe3c6f6606521839552eed7b8be","observation_id":"4ed0157a-9167-4bc7-b5e0-d26bd703336f","resolution":{"observed_at":"2026-08-15T17:24:08.392660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-16T16:28:15.445578Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-15T17:24:08.397621Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.397621Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:2a9139255972e6ce92c5197069caabe472197755ddb98cd35fa7a42c5219ff8f","observation_id":"96109899-f9ff-431b-b58f-a0ed11b218ed","resolution":{"observed_at":"2026-08-15T17:24:08.397621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08545","last_updated":"2022-11-15T22:31:38Z","snapshot_observed_at":"2026-08-16T16:15:52.382364Z","submitted_at":"2022-11-15T22:31:38Z","title":"MapQA: A Dataset for Question Answering on Choropleth Maps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.08545","snapshot_observed_at":"2026-08-15T17:24:08.402852Z","title":"Mapqa: A dataset for question answering on choropleth maps","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.402852Z"},"links":{"cited_paper":"/paper/2211.08545","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:9171171a810f4fbf72e5d0103dee44125dd594c024caa35cf16a66c02eb4486e","observation_id":"48732e57-7c6b-425b-8266-7a93b8ea40f1","resolution":{"observed_at":"2026-08-15T17:24:08.402852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15915","last_updated":"2024-06-19T03:58:32Z","snapshot_observed_at":"2026-08-16T14:31:39.382881Z","submitted_at":"2023-12-26T07:20:55Z","title":"ChartBench: A Benchmark for Complex Visual Reasoning in Charts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15915","snapshot_observed_at":"2026-08-15T17:24:08.407822Z","title":"Chartbench: A benchmark for complex visual reasoning in charts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.407822Z"},"links":{"cited_paper":"/paper/2312.15915","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:6782dbfeeef094790e7bb1df07d1b62312d6ab4e57c7b58e731b6e0171d45ea0","observation_id":"2ae55cf7-6324-4e57-b2c2-2e1e7fa2bfe2","resolution":{"observed_at":"2026-08-15T17:24:08.407822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.412542Z","title":"Unichart: A universal vision-language pretrained model for chart comprehension and reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.412542Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:80a0991e4c6a368e074278ebb7dbbcccee4b4ede1978a5e38b412466ce490213","observation_id":"23c48653-37e2-4852-b360-82b30dbae3e2","resolution":{"observed_at":"2026-08-15T17:24:08.412542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.417054Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.417054Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:dd139d133477e3f8a6ea864921e528cb0075f7ad2d28176eaa0f563c3c8c467b","observation_id":"6132d4de-611d-43a2-9dc3-0ffc6e463a72","resolution":{"observed_at":"2026-08-15T17:24:08.417054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13824","last_updated":"2024-11-06T08:29:22Z","snapshot_observed_at":"2026-08-16T17:40:13.110829Z","submitted_at":"2024-10-17T17:48:54Z","title":"Harnessing Webpage UIs for Text-Rich Visual Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13824","snapshot_observed_at":"2026-08-15T17:24:08.422038Z","title":"Harnessing webpage uis for text-rich visual understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.422038Z"},"links":{"cited_paper":"/paper/2410.13824","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:4f8277a2b4ed9a8cdc3fa661d84b1992d2aef8735ed1a4c244d59a57fe4e79c9","observation_id":"30ce4f23-7c12-45e3-b24e-577d02c4cd73","resolution":{"observed_at":"2026-08-15T17:24:08.422038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04165","last_updated":"2021-07-20T23:22:27Z","snapshot_observed_at":"2026-08-16T18:25:56.569719Z","submitted_at":"2021-05-10T07:46:55Z","title":"Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04165","snapshot_observed_at":"2026-08-15T17:24:08.427313Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.427313Z"},"links":{"cited_paper":"/paper/2105.04165","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:6e1f9896e8dc8a67be26608507ca0aabc7ed1e645e381c2f52e62ef9aaab59d1","observation_id":"9418bd85-c530-41be-aeeb-1d4b5681b22b","resolution":{"observed_at":"2026-08-15T17:24:08.427313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.432638Z","title":"An augmented benchmark dataset for geometric question answering through dual parallel text encoding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.432638Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:2b3420e988d45a9b6bf8f0bd1dc75886e18dcf4453a1f6e6dcae3d0fa0c126a5","observation_id":"769eb7e2-f057-4600-a319-7c77768b5187","resolution":{"observed_at":"2026-08-15T17:24:08.432638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.02746","last_updated":"2022-12-06T04:37:51Z","snapshot_observed_at":"2026-08-16T16:10:44.189376Z","submitted_at":"2022-12-06T04:37:51Z","title":"UniGeo: Unifying Geometry Logical Reasoning via Reformulating Mathematical Expression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.02746","snapshot_observed_at":"2026-08-15T17:24:08.437400Z","title":"Unigeo: Unifying geometry logical reasoning via reformulating mathematical expression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.437400Z"},"links":{"cited_paper":"/paper/2212.02746","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:1234a4091bb251cf7075e07cb213f8f59db0509dd853ea60e8f192c47f8b73b2","observation_id":"d08d20f2-47c6-4c1f-a5ad-588660b69e8b","resolution":{"observed_at":"2026-08-15T17:24:08.437400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14517","last_updated":"2022-01-11T03:50:31Z","snapshot_observed_at":"2026-08-17T03:33:20.954386Z","submitted_at":"2021-05-30T12:34:17Z","title":"GeoQA: A Geometric Question Answering Benchmark Towards Multimodal Numerical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14517","snapshot_observed_at":"2026-08-15T17:24:08.442245Z","title":"Geoqa: A geometric question answering benchmark towards multimodal numerical reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.442245Z"},"links":{"cited_paper":"/paper/2105.14517","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:bb835d42dfa966756664e20c97260b9f437668aa2d9fa4dc96868007ef868958","observation_id":"3b5cebb5-9ff0-4f8d-88d3-4b0a296a8cf4","resolution":{"observed_at":"2026-08-15T17:24:08.442245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.447210Z","title":"Solving geometry problems: Combining text and diagram interpretation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.447210Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:eb6af65ee8c60b5eb42e56b93462491e37746989b3ad96d85fdb21330ce5377a","observation_id":"84cebb8a-e84c-4ded-942a-a9e0dab82fb6","resolution":{"observed_at":"2026-08-15T17:24:08.447210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05358","last_updated":"2022-08-10T14:08:34Z","snapshot_observed_at":"2026-08-16T16:39:58.404449Z","submitted_at":"2022-08-10T14:08:34Z","title":"CLEVR-Math: A Dataset for Compositional Language, Visual and Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.05358","snapshot_observed_at":"2026-08-15T17:24:08.452090Z","title":"Clevr-math: A dataset for com- positional language, visual and mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.452090Z"},"links":{"cited_paper":"/paper/2208.05358","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:f76d681b5f518fce6f073db01a68ace0f85de99fca3d6dc9a0dbedbd9945c375","observation_id":"69d8adda-2460-48f0-be5b-5764e70775e3","resolution":{"observed_at":"2026-08-15T17:24:08.452090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13214","last_updated":"2022-07-25T04:05:29Z","snapshot_observed_at":"2026-08-16T20:04:49.795889Z","submitted_at":"2021-10-25T18:52:26Z","title":"IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13214","snapshot_observed_at":"2026-08-15T17:24:08.457298Z","title":"Iconqa: A new benchmark for abstract diagram understanding and visual language reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.457298Z"},"links":{"cited_paper":"/paper/2110.13214","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:35bbc991f05142bb430918c472e8b45f6d6c5a17f15dbe39330ce3e10bb5717f","observation_id":"1ae9e6f8-e958-4a16-bd67-35a411a8f7fa","resolution":{"observed_at":"2026-08-15T17:24:08.457298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00491","last_updated":"2019-07-21T05:26:36Z","snapshot_observed_at":"2026-08-14T18:05:37.795597Z","submitted_at":"2018-11-01T16:47:44Z","title":"A Corpus for Reasoning About Natural Language Grounded in Photographs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00491","snapshot_observed_at":"2026-08-15T17:24:08.462326Z","title":"A corpus for reasoning about natural language grounded in photographs","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.462326Z"},"links":{"cited_paper":"/paper/1811.00491","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:f315f1048957dc29896751484bb9d3b95fa505f6010b03052b6a55151b66df18","observation_id":"3229e0cd-4c93-42b0-a050-a02eba852c68","resolution":{"observed_at":"2026-08-15T17:24:08.462326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15867","last_updated":"2022-03-29T19:18:12Z","snapshot_observed_at":"2026-08-16T17:10:48.910235Z","submitted_at":"2022-03-29T19:18:12Z","title":"Image Retrieval from Contextual Descriptions","version":1},"cited_work":{"arxiv_id":"2203.15867","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.15867","snapshot_observed_at":"2026-08-15T17:24:08.763505Z","title":"Image Retrieval from Contextual Descriptions","venue":"cs.CV","work_id":"9e3e6eb7-37b2-480a-aab9-9bbf267fa480","year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.467219Z"},"links":{"cited_paper":"/paper/2203.15867","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:22b6cb12b4a065f432f18c2d242890e961c1470751882ab95788cb2332302d18","observation_id":"4e6016ae-9dd9-47a4-b9a8-4917f9ef2ff6","resolution":{"observed_at":"2026-08-15T17:24:08.770841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.472416Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.472416Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:862b80e746bb14199815a9ea7d1fc7380caef84026d6d83a608d35a45c4ec92f","observation_id":"6a872cae-9d7c-4986-9b99-f5f33a6cec46","resolution":{"observed_at":"2026-08-15T17:24:08.472416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:10.019449Z","title":"Super-clevr: A virtual benchmark to diagnose domain robustness in visual reasoning","venue":null,"work_id":"05167e3a-f584-47a0-ad74-9133ce4e9ff5","year":2023},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.477274Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:6cf28e20178767517ab9ee18646826c6471b393669ad43c67aafbb5b4f658b04","observation_id":"eb282081-0b1c-42d3-8e7d-198b15c2a976","resolution":{"observed_at":"2026-08-15T17:24:10.024942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.481966Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.481966Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:aa237131634e36cead24e1cf8a14f85713d817f60a65ef78515f846eaacd10b2","observation_id":"de48a35c-7bd1-4689-8db8-a768aece6e2e","resolution":{"observed_at":"2026-08-15T17:24:08.481966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:09.989948Z","title":"Are you smarter than a sixth grader? textbook question answering for multimodal machine comprehension","venue":null,"work_id":"f6e30604-cc6e-49fb-b77f-2dacad0324b3","year":2017},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.486479Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:e1bf3fd6e2fe2b05803872a93eaa713a37dca38fbaef0ede827696ff00bfdb4e","observation_id":"d15722cf-d116-4081-a0d7-a43e7e8b4b34","resolution":{"observed_at":"2026-08-15T17:24:09.996101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.490975Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.490975Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:0ecfb0b0abcccf90ac6d78f002cbf65e822df75f21974ce1bb7182a336097213","observation_id":"cd6f8cb2-0f48-4a38-a74d-5288742c67d2","resolution":{"observed_at":"2026-08-15T17:24:08.490975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.495486Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.495486Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:4f71eaf4da54e32b3675cb732b722a39166ee1f90d041175259e6e4a78a58274","observation_id":"ab713047-994d-4443-8b21-b87b0005d038","resolution":{"observed_at":"2026-08-15T17:24:08.495486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.500513Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.500513Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:5656a7b9e8c25294d8949bc27a68b7ac633c5e473576c11c4a18be062866bd01","observation_id":"bfe0133e-91c3-4c81-85a7-0729729d3aa8","resolution":{"observed_at":"2026-08-15T17:24:08.500513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.505250Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.505250Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:0fb1b1fbc5dd7d76f38b76c1bd4921160584de75a308df6527e664dbdc0b7a6d","observation_id":"b17bf1cf-2bfd-4532-bedf-bc28197e34dd","resolution":{"observed_at":"2026-08-15T17:24:08.505250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.510153Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.510153Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:ffccb40aabcf357c97069fd8a597aeb8e2d2797c32a16613b8f34b35c969ae08","observation_id":"e24b1632-9004-4fb0-b05f-7da7199d71b8","resolution":{"observed_at":"2026-08-15T17:24:08.510153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10415","last_updated":"2024-09-08T01:04:35Z","snapshot_observed_at":"2026-08-15T13:17:09.334808Z","submitted_at":"2023-05-17T17:50:16Z","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10415","snapshot_observed_at":"2026-08-15T17:24:08.514831Z","title":"Pmc-vqa: Visual instruction tuning for medical visual question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.514831Z"},"links":{"cited_paper":"/paper/2305.10415","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:0c3216ca68e5236b226e97da4d09dde58665fb1d93f4a90a01ad46b0b4c2d5fc","observation_id":"15866e9d-4e44-40d8-9ab7-a6b5d64790b7","resolution":{"observed_at":"2026-08-15T17:24:08.514831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T17:24:08.519580Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.519580Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:f6f3bfdb6c4bef176b4745b0ff26a1105a73abed36750abbb70d38f265f89067","observation_id":"0d26467e-9283-4c20-9eb0-d4c876cad2fb","resolution":{"observed_at":"2026-08-15T17:24:08.519580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:08.524451Z","title":"Chart-r1: Chain-of-thought supervision and reinforcement for advanced chart reasoner","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.524451Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:f56f34372c75878c3e3cff53d2add5f23a2ecd62edac9420ec6892cf7bc6c62d","observation_id":"f701a439-9b26-42c4-9d6f-f0b003162a47","resolution":{"observed_at":"2026-08-15T17:24:08.524451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:24:09.917003Z","title":"You are a QUESTION-TYPE classifier (do **NOT** answer the question itself)","venue":null,"work_id":"f22eb4c3-3a8c-42a0-b6c0-aa452b1ce84c","year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.529010Z"},"links":{"citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:6e3eb08e9d32b39de197921b8898b5a165f0ff047752909d27f030872d62ef32","observation_id":"76ea1cc2-7929-4419-bcf2-0c36ff67336e","resolution":{"observed_at":"2026-08-15T17:24:09.922336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T17:40:57.040221Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":96,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":113},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 113 outbound references and 4 inbound Pith citation observations for arXiv:2508.12680."}