{"as_of":"2026-08-10T13:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2ec066407c8ecef8d850568a287d7822f69e16a87d668fd6ad4ef83ce6ba7fb5","coverage":[{"denominator":125,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:27:05.282142Z","state":"measured"},{"denominator":108,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":108,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:57:07.475851Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:39:46.104997Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07905","snapshot_observed_at":"2026-08-06T13:57:07.475851Z","title":"WeThink: To- ward general-purpose vision-language reasoning via rein- forcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19891","last_updated":"2025-07-30T04:47:07Z","snapshot_observed_at":"2026-08-09T03:50:13.576578Z","submitted_at":"2025-07-26T09:43:09Z","title":"Interpretable Open-Vocabulary Referring Object Detection with Reverse Contrast Attention","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:07.475851Z"},"links":{"cited_paper":"/paper/2506.07905","citing_paper":"/paper/2507.19891"},"observation_digest":"sha256:179dc63c331309db0eba0b1e0703809f172610bc260dd3a76322a6965614f14f","observation_id":"db245629-0bcf-49c4-9b7c-5aa648952409","resolution":{"observed_at":"2026-08-06T13:57:07.475851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07905","snapshot_observed_at":"2026-08-05T23:03:10.158919Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06009","last_updated":"2025-08-08T04:39:16Z","snapshot_observed_at":"2026-08-06T16:03:13.511884Z","submitted_at":"2025-08-08T04:39:16Z","title":"MathReal: We Keep It Real! A Real Scene Benchmark for Evaluating Math Reasoning in Multimodal Large Language Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T23:03:10.158919Z"},"links":{"cited_paper":"/paper/2506.07905","citing_paper":"/paper/2508.06009"},"observation_digest":"sha256:2e57e6693dffd65ab5a7e4bf05db108b0df1e372482ca4061edb45c762ef0d77","observation_id":"81f9e82d-4567-4976-9de0-b0ba9a4a3bb7","resolution":{"observed_at":"2026-08-05T23:03:10.158919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.07905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07905","snapshot_observed_at":"2026-07-04T10:39:46.104997Z","title":"Wethink: Toward general-purpose vision- language reasoning via reinforcement learning.arXiv preprint arXiv:2506.07905, 2025a","venue":null,"work_id":"0bdc8453-564e-45ce-8ac2-22be4b0bda04","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":238,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2506.07905","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:c5e0c0051c82032ed5fad98e8480c3c8dbb839b9900aa7e2c39c569007672faf","observation_id":"48e25eed-7b27-47cf-834e-9b44876c6c93","resolution":{"observed_at":"2026-05-18T19:21:48.853224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07905","snapshot_observed_at":"2026-08-03T14:57:29.176406Z","title":"Wethink: To- ward general-purpose vision-language reasoning via rein- forcement learning.arXiv preprint arXiv:2506.07905, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.18735","last_updated":"2026-05-25T12:55:14Z","snapshot_observed_at":"2026-08-07T05:11:54.627363Z","submitted_at":"2025-12-21T13:50:26Z","title":"$M^3-Verse$: A \"Spot the Difference\" Challenge for Large Multimodal Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T14:57:29.176406Z"},"links":{"cited_paper":"/paper/2506.07905","citing_paper":"/paper/2512.18735"},"observation_digest":"sha256:46311352a5da8e9d276b1636764555509f6c2d9e3be3ef135913ab2d4f8013f7","observation_id":"0664b863-da57-4521-b0a4-9e6706ad160d","resolution":{"observed_at":"2026-08-03T14:57:29.176406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.07905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07905","snapshot_observed_at":"2026-07-04T10:39:46.104997Z","title":"Wethink: Toward general-purpose vision- language reasoning via reinforcement learning.arXiv preprint arXiv:2506.07905, 2025a","venue":null,"work_id":"0bdc8453-564e-45ce-8ac2-22be4b0bda04","year":2025},"citing_paper":{"arxiv_id":"2604.19264","last_updated":"2026-04-21T09:28:34Z","snapshot_observed_at":"2026-07-31T12:03:21.545054Z","submitted_at":"2026-04-21T09:28:34Z","title":"DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-10T03:21:30.732925Z"},"links":{"cited_paper":"/paper/2506.07905","citing_paper":"/paper/2604.19264"},"observation_digest":"sha256:0d53a58a1a30469b537b60427880e04697eaaa8c62d9b8bc76777115c0bcc522","observation_id":"c6b81be2-5b5c-4e7c-a979-e9098ce6c857","resolution":{"observed_at":"2026-05-11T12:31:07.983014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.07905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07905","snapshot_observed_at":"2026-07-04T10:39:46.104997Z","title":"Wethink: Toward general-purpose vision- language reasoning via reinforcement learning.arXiv preprint arXiv:2506.07905, 2025a","venue":null,"work_id":"0bdc8453-564e-45ce-8ac2-22be4b0bda04","year":2025},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2506.07905","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:bea5812ac6c4af2ec85b9624a655f9c1cbdf23fe29abc7c58f35694a204eb9a0","observation_id":"6983eb48-fcc7-4ed4-9e77-1de6f3922bfd","resolution":{"observed_at":"2026-05-20T05:13:21.563530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.07905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07905","snapshot_observed_at":"2026-07-04T10:39:46.104997Z","title":"Wethink: Toward general-purpose vision- language reasoning via reinforcement learning.arXiv preprint arXiv:2506.07905, 2025a","venue":null,"work_id":"0bdc8453-564e-45ce-8ac2-22be4b0bda04","year":2025},"citing_paper":{"arxiv_id":"2606.23543","last_updated":"2026-06-22T16:17:30Z","snapshot_observed_at":"2026-08-09T03:52:59.244753Z","submitted_at":"2026-06-22T16:17:30Z","title":"VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T08:34:27.719022Z"},"links":{"cited_paper":"/paper/2506.07905","citing_paper":"/paper/2606.23543"},"observation_digest":"sha256:28d8ddcf6c89a463b7b9a495c2da25873f2521a35db6cbf15d942c4cd7b38b34","observation_id":"09b8ffd8-cfb9-4af7-b9d0-3ed26b71c759","resolution":{"observed_at":"2026-07-04T10:39:46.106878Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07905","snapshot_observed_at":"2026-08-01T11:47:28.164827Z","title":"WeThink: Toward general-purpose vision-language reasoning via reinforcement learn- ing.arXiv preprint arXiv:2506.07905, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-06T04:55:07.559078Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:28.164827Z"},"links":{"cited_paper":"/paper/2506.07905","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:1e9221b09603cdd87a9c8f850c965ead26dd245ee433ccf7081f4f2ee0c5dba8","observation_id":"a38f450c-7479-419e-a93a-2d14d92ed709","resolution":{"observed_at":"2026-08-01T11:47:28.164827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07905/citation-record","integrity":"/paper/2506.07905/integrity","json":"/paper/2506.07905/citation-record.json","paper":"/paper/2506.07905"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T05:27:04.910573Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.910573Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:eaff6cda91855802db135fdaa1e5e3068e6059a624f160059d68da6d5fca825b","observation_id":"a2f85b3b-0818-41ce-9958-2cae1fc7f270","resolution":{"observed_at":"2026-08-07T05:27:04.910573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:04.914834Z","title":"Openai o3 and o4-mini system card, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.914834Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:a0b9cabc6f914661e81b6a19664a322c3adb4063e27e05b87d1f3f9097413e47","observation_id":"978c1cab-a1dd-4444-89c9-6ad7b5172600","resolution":{"observed_at":"2026-08-07T05:27:04.914834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T05:27:04.918664Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.918664Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:52d7e450c0f1b86ccf83787d2cc471628e69b88b2175a0eb386dbadd2d528296","observation_id":"4843fe97-3092-45f2-bf8c-925fce292f34","resolution":{"observed_at":"2026-08-07T05:27:04.918664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:27:04.922660Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.922660Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:39fb41c9d162e4ef86eaa40cc3e0f5b94bff32fb8254f9db6b001e2cad4f8961","observation_id":"f9fbe446-e9d6-4e54-8d3b-2e4157656162","resolution":{"observed_at":"2026-08-07T05:27:04.922660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-07T05:27:04.926476Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training.arXiv preprint arXiv:2501.17161, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.926476Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:2bdf9fbda0c17263b28c82a77a0c83c35ba8a4eea205e661bcc9c249154d6c89","observation_id":"03394a63-8b2d-453b-831a-db6468728ed7","resolution":{"observed_at":"2026-08-07T05:27:04.926476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T05:27:04.930282Z","title":"s1: Simple test-time scaling.arXiv preprint arXiv:2501.19393, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.930282Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:77bd117311108bcd740480beea5c15363ae7375a4dee2bd397a6ab4f03491ba4","observation_id":"3fb95a9b-1dc8-4365-8085-9f50c9b4469e","resolution":{"observed_at":"2026-08-07T05:27:04.930282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-07T05:27:04.934233Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models.arXiv preprint arXiv:2504.11468, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.934233Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:c0251a21f810c7bcf67c16b0178badc4fbce3731eb8aff2e30a3286fd79c25df","observation_id":"822dc9e1-c613-4d34-ac15-2d56b77e2daa","resolution":{"observed_at":"2026-08-07T05:27:04.934233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-07T05:27:04.938064Z","title":"Open- vlthinker: An early exploration to complex vision-language reasoning via iterative self- improvement.arXiv preprint arXiv:2503.17352, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.938064Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:20bdbca25c625fe149802cfd1c9d6ae880dba9331c9058971cdbd296c26df145","observation_id":"495b0a75-d03b-463d-83cb-f010a3d40fbf","resolution":{"observed_at":"2026-08-07T05:27:04.938064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-07T05:27:04.941900Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization.arXiv preprint arXiv:2503.12937, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.941900Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:6d5d346cdeee5072043f615ba702c72f1027f75e8e10b458ee0c60f3d68f928f","observation_id":"5894646a-2c5d-4728-b863-800dbed0db4a","resolution":{"observed_at":"2026-08-07T05:27:04.941900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-07T05:27:04.945637Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization.arXiv preprint arXiv:2503.10615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.945637Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:203c66142c6635543d7bb14a80b4660d912a0f05cb406a3901681fa519eff6a1","observation_id":"b32720cc-9242-4df5-9434-3ef7c2fcbb91","resolution":{"observed_at":"2026-08-07T05:27:04.945637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10291","last_updated":"2025-03-13T12:03:37Z","snapshot_observed_at":"2026-08-07T21:25:47.268391Z","submitted_at":"2025-03-13T12:03:37Z","title":"VisualPRM: An Effective Process Reward Model for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10291","snapshot_observed_at":"2026-08-07T05:27:04.949338Z","title":"Visualprm: An effective process reward model for multimodal reasoning.arXiv preprint arXiv:2503.10291, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.949338Z"},"links":{"cited_paper":"/paper/2503.10291","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:fa1f6b9ec3898dd53342700d16aa69f932828e9e53a87f87f4d3ecdee7709f5f","observation_id":"b65f2783-cb81-4d0b-81c6-d4f0b5b9c89e","resolution":{"observed_at":"2026-08-07T05:27:04.949338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T05:27:04.953540Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models.arXiv preprint arXiv:2503.06749, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.953540Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:22cd1d918f9c66ca24bf64ff463ee3ba854edd242e418df6a4ccb7eaae85cc7a","observation_id":"52f93ccf-1a8f-4b7b-a910-5f065c564f82","resolution":{"observed_at":"2026-08-07T05:27:04.953540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-07T05:27:04.957024Z","title":"Vl- rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.957024Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:fa7c3e87f7a61fc7fcda1f50e982e4be4d3c807491237a8f997e22626f12379d","observation_id":"853b1ea0-8045-4c13-85fe-1bc958a89ac2","resolution":{"observed_at":"2026-08-07T05:27:04.957024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16656","last_updated":"2025-06-06T07:27:18Z","snapshot_observed_at":"2026-08-07T15:59:55.050120Z","submitted_at":"2025-04-23T12:24:10Z","title":"Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16656","snapshot_observed_at":"2026-08-07T05:27:04.960499Z","title":"Skywork r1v2: Multimodal hybrid reinforcement learning for reasoning.arXiv preprint arXiv:2504.16656, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.960499Z"},"links":{"cited_paper":"/paper/2504.16656","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:2fbfa48032d1b82fcbb4b5961cb6bea6f73d3d1ff64d3731ed1ffe60c06bc4a3","observation_id":"c9527092-abfe-40c2-90fc-066cb510a9a0","resolution":{"observed_at":"2026-08-07T05:27:04.960499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:04.964036Z","title":"Noisyrollout: Reinforcing visual reasoning with data augmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.964036Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:3cb703b31c361ae4b220dbe6e927a350c3c31607753ab26a0c9c4857243a5e2c","observation_id":"2be5a1d3-a000-4c5f-9957-538d64e23047","resolution":{"observed_at":"2026-08-07T05:27:04.964036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:04.967572Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.967572Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:49513213ae249a4795b28523e28f0676f71ddf387c78e05b990e872a2e08cffd","observation_id":"931c915c-c4eb-46fc-a16f-3c8a5d0e56df","resolution":{"observed_at":"2026-08-07T05:27:04.967572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-07-06T16:09:09.018523Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-07T05:27:04.971025Z","title":"Seamlessm4t: Massively multilingual & multimodal machine translation.arXiv preprint arXiv:2308.11596, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.971025Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:cccfb874d00a611846e3ad3c60c25152a097b6ae7f5b3dca68d94176a6d3cd2b","observation_id":"4360f939-c564-4e2d-b0db-dd4d8b278137","resolution":{"observed_at":"2026-08-07T05:27:04.971025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:04.974789Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing.IEEE Journal of Selected Topics in Signal Processing, 16(6):1505–1518, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.974789Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:85f47e2878dc9d8560b2bea245318356a126439ad1b6ed62c99a37f5a92e8769","observation_id":"734dfa59-790b-4812-9760-d728fd635084","resolution":{"observed_at":"2026-08-07T05:27:04.974789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T05:27:04.979169Z","title":"Videochat: Chat-centric video understanding.arXiv preprint arXiv:2305.06355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.979169Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:aad19488a8e8b4debbcd57899c8509befc648f010729438161da69cb5ba4e8a2","observation_id":"43752052-9380-4f73-bef0-41ec3dc11c36","resolution":{"observed_at":"2026-08-07T05:27:04.979169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T05:27:04.982714Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding.arXiv preprint arXiv:2306.02858, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.982714Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:75412d865dfc1668140fae5a5e6e8b6a549b962763e470eb2dc08060140c91c2","observation_id":"ad8d57d7-e276-4a9d-acab-25b25134dd35","resolution":{"observed_at":"2026-08-07T05:27:04.982714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T05:27:04.986725Z","title":"Minigpt-4: En- hancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.986725Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:6a9aee75a3af6f57294de8a006b55b6fe8b9e15c7236ba7eb907b483ea2f2aa9","observation_id":"53b78e31-cdda-46c9-8643-9501c5f25b5c","resolution":{"observed_at":"2026-08-07T05:27:04.986725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T05:27:04.990004Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.990004Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:dfd3df6baeefb4f5b59545940f8fb13addc3b110d4f6d3108668a095031164bb","observation_id":"0bb33cbc-892d-4c18-906c-d4aadfe706ef","resolution":{"observed_at":"2026-08-07T05:27:04.990004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:04.993533Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.993533Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:39f1e0e9930ad0412446f11d57de34b0d2aa96598c59c08362ed7d4806614ec5","observation_id":"3691229f-741c-4818-8bb2-a29dd3b1b139","resolution":{"observed_at":"2026-08-07T05:27:04.993533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:04.997106Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:04.997106Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:af7cc5b83a5dd9e66b9cb18a5e1a2f4121a109b3d44c12861d554e801539f457","observation_id":"cca83f3e-479e-4246-af88-9e0ac8d0177e","resolution":{"observed_at":"2026-08-07T05:27:04.997106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T05:27:05.000341Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.000341Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:e7464c7ea36a21485ee311b161d39939abce9420f9ec98fad29cae27c22fbca8","observation_id":"773ba099-657e-40ee-b8de-4024deea19f1","resolution":{"observed_at":"2026-08-07T05:27:05.000341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T05:27:05.004085Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.004085Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:ac48aab9aeed656348cfe2b035900b2a1b31dda11a81f05a52f32e1960755c13","observation_id":"f2523b7a-b2f7-45dc-9ef8-6112f043af83","resolution":{"observed_at":"2026-08-07T05:27:05.004085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.007607Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.007607Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:e0a90b81f1c9e41a79abf0ca7669f037179ec7d78610e97a93a046d4f761462c","observation_id":"ea755578-ed6e-48c1-a8fc-4b270399c075","resolution":{"observed_at":"2026-08-07T05:27:05.007607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T05:27:05.011264Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.011264Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:7e3bf7386462dac31dfb6f33726187b35d1f3a0560ba70965b718b7490aebcb4","observation_id":"c6e4bad6-63ba-4c71-bc04-1cd724b58701","resolution":{"observed_at":"2026-08-07T05:27:05.011264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.014866Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.014866Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:ea5ed5a5aeae9e3a14727c3c6b5defdf7dc463b64aeb116ca18c42086b42f9e4","observation_id":"85856486-bfae-44a9-a157-c0638ef44a41","resolution":{"observed_at":"2026-08-07T05:27:05.014866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T05:27:05.018179Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.arXiv preprint arXiv:2404.16821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.018179Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:b6b272b90a7725378118a2e0b36ad01461f8f001f14383905e7042264a903854","observation_id":"866e57e5-febe-4c62-a48f-569875f5fdc9","resolution":{"observed_at":"2026-08-07T05:27:05.018179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T05:27:05.021821Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.021821Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:059f0f227539dd36b0e9cc7ad3636c692df1334a6ed12f71c353ed2444d82a97","observation_id":"4d41cacd-b65d-4fad-ad0e-98d679aad327","resolution":{"observed_at":"2026-08-07T05:27:05.021821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T05:27:05.025413Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.025413Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:7a567ea59b7b6829af6184c59568fced9ac49687d4c0e403c621fe84a52d0a61","observation_id":"743ef82d-e42c-42e6-9bdd-0f9672ef23e6","resolution":{"observed_at":"2026-08-07T05:27:05.025413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T05:27:05.028712Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.028712Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:721ecf69715bb921b694f46f1923cfbef072f5da0f1b111accc903b51ec0a239","observation_id":"c9f02f92-f888-404a-bb3a-02e0f1357460","resolution":{"observed_at":"2026-08-07T05:27:05.028712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T05:27:05.032184Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.032184Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:b5f660aa5b818d49fe78020d6a0700b88f4d2a8bb2d8bfe469172a59fd350a35","observation_id":"a55093e7-af8c-4648-80c8-294a51b3d510","resolution":{"observed_at":"2026-08-07T05:27:05.032184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.035668Z","title":"Claude.https://www.anthropic.com/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.035668Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:869ed0c04734b71b7439ce409fb40f3f64ce4d13f4d6f955aae0b00ab503a94d","observation_id":"c1f62a4c-2475-4afe-8820-7f6546cb2512","resolution":{"observed_at":"2026-08-07T05:27:05.035668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.039295Z","title":"Grok.https://x.ai/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.039295Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:53a2f8596ddbca112986d94dc77ac0afb83469eee97919e8f265b6370fd24d87","observation_id":"a1f81c7e-41dc-4c9f-a147-ca620750ba25","resolution":{"observed_at":"2026-08-07T05:27:05.039295Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.042756Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.042756Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:5479557b4fb65dfd778cac094e352110bc3f1d8d5e908206684af746683d5439","observation_id":"580d4b2b-7a81-4cf8-a2d8-cf1b67f926ee","resolution":{"observed_at":"2026-08-07T05:27:05.042756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.046056Z","title":"Large language models are zero-shot reasoners.Advances in neural information processing systems, 35:22199–22213, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.046056Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:16517cade85bd2ca9c7a679f53fbb5ba47760bbb58690623b4b3e6d9dbaa7f87","observation_id":"217880b1-42c6-488a-b0f8-96e668dc1cee","resolution":{"observed_at":"2026-08-07T05:27:05.046056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T05:27:05.050109Z","title":"Mul- timodal chain-of-thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.050109Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:f66f0e21895b984f311b2fee0d5217131ccfa5f1581420348e0afecc608ad0a5","observation_id":"373b2e0a-d748-48a8-967e-69b399de2ec1","resolution":{"observed_at":"2026-08-07T05:27:05.050109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.053861Z","title":"Chameleon: Plug-and-play compositional reasoning with large language models.Advances in Neural Information Processing Systems, 36:43447–43478, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.053861Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:ba03804b70a3544c8980d9bac4af326655e90bde5f23cfea5a5a1c2ec3b1eeef","observation_id":"f00f1f6c-04fc-4e3f-8008-a8d0088b3fbf","resolution":{"observed_at":"2026-08-07T05:27:05.053861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.057374Z","title":"Layoutllm: Layout instruction tuning with large language models for document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.057374Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:61d77d093f0671b2f90b25a3780dad5040dc366bfa41ad8a230e4ceb988c4010","observation_id":"eed55363-e79c-4b63-834e-d9e1eb30dab3","resolution":{"observed_at":"2026-08-07T05:27:05.057374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-07T05:27:05.060976Z","title":"Mm-react: Prompting chatgpt for multimodal reasoning and action.arXiv preprint arXiv:2303.11381, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.060976Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:fd2f01f89dd333e50eec60163712066417a750e0c7663efd8b77d094069b1c0f","observation_id":"2b587f56-f0a4-4f1f-a570-c273cdc5878a","resolution":{"observed_at":"2026-08-07T05:27:05.060976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02582","last_updated":"2024-01-05T00:26:07Z","snapshot_observed_at":"2026-08-09T16:57:52.708316Z","submitted_at":"2024-01-05T00:26:07Z","title":"CoCoT: Contrastive Chain-of-Thought Prompting for Large Multimodal Models with Multiple Image Inputs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02582","snapshot_observed_at":"2026-08-07T05:27:05.064735Z","title":"Cocot: Contrastive chain-of-thought prompting for large multimodal models with multiple image inputs.arXiv preprint arXiv:2401.02582, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.064735Z"},"links":{"cited_paper":"/paper/2401.02582","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:f98e20e2d584194c6cb8e4680ceaf6d86d4d8fc6e3d1d3298a4eb1fb0e18392d","observation_id":"5793574b-1f18-435d-8eb9-a6f95939c91f","resolution":{"observed_at":"2026-08-07T05:27:05.064735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.068394Z","title":"Compositional chain-of- thought prompting for large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.068394Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:8b96cd8a74f395ade4e7d2befaa4a1cbbb1f6e5bbcf50279b2d7ef75b4db1408","observation_id":"25e96661-8911-472f-b823-13befa0f4b47","resolution":{"observed_at":"2026-08-07T05:27:05.068394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.072062Z","title":"Ddcot: Duty-distinct chain-of-thought prompting for multimodal reasoning in language models.Advances in Neural Information Processing Systems, 36:5168–5191, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.072062Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:8a9bc0ddd03632afe0d94561ace8955f948e46f75d3b2b16f51330f0b1ef0b40","observation_id":"4093cbf7-d757-4e22-86d6-75ffac09711c","resolution":{"observed_at":"2026-08-07T05:27:05.072062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03321","last_updated":"2024-10-04T11:18:41Z","snapshot_observed_at":"2026-08-08T00:04:38.954111Z","submitted_at":"2024-10-04T11:18:41Z","title":"Visual-O1: Understanding Ambiguous Instructions via Multi-modal Multi-turn Chain-of-thoughts Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03321","snapshot_observed_at":"2026-08-07T05:27:05.075376Z","title":"Visual-o1: Understanding am- biguous instructions via multi-modal multi-turn chain-of-thoughts reasoning.arXiv preprint arXiv:2410.03321, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.075376Z"},"links":{"cited_paper":"/paper/2410.03321","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:2f1062c0f148f4a84bf196374df7b74907574e3e225e04ac7b1bb6f483bb06c4","observation_id":"c88c960c-7624-418f-870a-1bde9f3e909d","resolution":{"observed_at":"2026-08-07T05:27:05.075376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.078937Z","title":"Visual chain-of-thought prompting for knowledge-based visual reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.078937Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:9252aab09b38c2cfcf475092a2f2a9398fab6a52e29d55010f8e627b5a65872a","observation_id":"722c6d23-e56b-4f1e-8965-a73b0ea02771","resolution":{"observed_at":"2026-08-07T05:27:05.078937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T05:27:05.083376Z","title":"Llava-o1: Let vision language models reason step-by-step.arXiv preprint arXiv:2411.10440, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.083376Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:7c61dc3d63934853f7dcd212504ea285c11b1158bf52fc24cfb8078910f6a081","observation_id":"8b2136dc-12f3-45aa-8bda-ac0ed1d08a1c","resolution":{"observed_at":"2026-08-07T05:27:05.083376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14432","snapshot_observed_at":"2026-08-07T05:27:05.088125Z","title":"Insight-v: Exploring long-chain visual reasoning with multimodal large language models.arXiv preprint arXiv:2411.14432, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.088125Z"},"links":{"cited_paper":"/paper/2411.14432","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:53ed120684b386bec6de34f0ba2fd99a78109085c57b47014dae02c30980f450","observation_id":"b21cc11a-7cb7-4090-b1d7-b43f9e8a02c6","resolution":{"observed_at":"2026-08-07T05:27:05.088125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-07T05:27:05.091700Z","title":"Llamav-o1: Rethinking step-by-step visual reasoning in llms.arXiv preprint arXiv:2501.06186, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.091700Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:58d5eabd8e8f0d2e9129a1c1aac99ec903e7117a16fc36f3dd350050caa3b02c","observation_id":"38fca845-86fc-4356-abf4-22a29e52629f","resolution":{"observed_at":"2026-08-07T05:27:05.091700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21277","last_updated":"2025-05-21T06:08:31Z","snapshot_observed_at":"2026-08-07T15:57:57.813561Z","submitted_at":"2025-04-30T03:14:28Z","title":"Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21277","snapshot_observed_at":"2026-08-07T05:27:05.095888Z","title":"Reinforced mllm: A survey on rl-based reasoning in multimodal large language models.arXiv preprint arXiv:2504.21277, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.095888Z"},"links":{"cited_paper":"/paper/2504.21277","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:53abb01d00ca1837728d3cd376872dbf9f45cee1643e3d3c9804ab38ba39be50","observation_id":"c4e8ca4e-e792-4925-8635-57e9b487c9aa","resolution":{"observed_at":"2026-08-07T05:27:05.095888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.099935Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.099935Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:e54a3adef73380ef6b7b275eca4e9275f599eb4e76b5a493db6591f9da8975ce","observation_id":"d226f46e-6381-44ed-a5dd-84a08c35a2d9","resolution":{"observed_at":"2026-08-07T05:27:05.099935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.103227Z","title":"Relation-r1: Cognitive chain-of-thought guided reinforcement learning for unified relational comprehension.arXiv preprint arXiv:2504.14642, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.103227Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:377662384bb39524a52e2eaed7cee85259568132b72bfbcdce2b69dd1f0308e4","observation_id":"f129975a-ae54-4a41-a608-82aca32d2b88","resolution":{"observed_at":"2026-08-07T05:27:05.103227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13617","last_updated":"2025-05-26T10:35:23Z","snapshot_observed_at":"2026-08-07T16:01:10.135028Z","submitted_at":"2025-04-18T10:46:22Z","title":"Compile Scene Graphs with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13617","snapshot_observed_at":"2026-08-07T05:27:05.106433Z","title":"Compile scene graphs with reinforcement learning.arXiv preprint arXiv:2504.13617, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.106433Z"},"links":{"cited_paper":"/paper/2504.13617","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:76554c82de361b230dd3276dc007d3139f69048bc1fea1a91aa38158a89ec2e1","observation_id":"aa3c6233-1240-410d-b735-770dffa707f5","resolution":{"observed_at":"2026-08-07T05:27:05.106433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12680","last_updated":"2025-04-17T06:16:11Z","snapshot_observed_at":"2026-08-07T16:01:36.502631Z","submitted_at":"2025-04-17T06:16:11Z","title":"Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12680","snapshot_observed_at":"2026-08-07T05:27:05.110383Z","title":"Embodied-r: Collaborative framework for activating embodied spatial reasoning in foundation models via reinforcement learning.arXiv preprint arXiv:2504.12680, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.110383Z"},"links":{"cited_paper":"/paper/2504.12680","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:31d14ae7c2eb76065c238497872d46424a7be57b63e32d0ca9f0fb595d1b89c9","observation_id":"fb0606e7-931c-4f6b-a038-f2783832d086","resolution":{"observed_at":"2026-08-07T05:27:05.110383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00883","last_updated":"2025-04-14T20:12:57Z","snapshot_observed_at":"2026-08-07T16:17:09.409469Z","submitted_at":"2025-04-01T15:11:11Z","title":"Improved Visual-Spatial Reasoning via R1-Zero-Like Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00883","snapshot_observed_at":"2026-08-07T05:27:05.114508Z","title":"Improved visual-spatial reasoning via r1-zero-like training.arXiv preprint arXiv:2504.00883, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.114508Z"},"links":{"cited_paper":"/paper/2504.00883","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:8ea592ef6841910e6e07574606679e1a80005e3eb2911d5a0bbf8b6383caf848","observation_id":"900592f3-cb75-485e-8f6d-57cc9329113b","resolution":{"observed_at":"2026-08-07T05:27:05.114508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21696","last_updated":"2025-05-14T17:48:02Z","snapshot_observed_at":"2026-08-07T16:32:15.166320Z","submitted_at":"2025-03-27T17:00:51Z","title":"Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21696","snapshot_observed_at":"2026-08-07T05:27:05.118106Z","title":"Embodied-reasoner: Synergizing visual search, reasoning, and action for embodied interactive tasks.arXiv preprint arXiv:2503.21696, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.118106Z"},"links":{"cited_paper":"/paper/2503.21696","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:3950ce3681d23a96ff1916f06c73f7ab94343fb3fac8188be8374f0cb364d722","observation_id":"d4216eaa-f78b-4267-8cf5-86dd6946c4ec","resolution":{"observed_at":"2026-08-07T05:27:05.118106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-07-06T20:48:18.268075Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-07T05:27:05.122122Z","title":"aha moment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.122122Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:943f2b307f85a7ca5af19550f3689192cb8419f55f8ed737ede810d28ac61d32","observation_id":"103c64de-bd83-4be8-9b3f-cd361c7ee95f","resolution":{"observed_at":"2026-08-07T05:27:05.122122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07954","last_updated":"2025-04-10T17:58:27Z","snapshot_observed_at":"2026-08-07T16:06:45.172290Z","submitted_at":"2025-04-10T17:58:27Z","title":"Perception-R1: Pioneering Perception Policy with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07954","snapshot_observed_at":"2026-08-07T05:27:05.125750Z","title":"Perception-r1: Pioneering perception policy with reinforcement learning.arXiv preprint arXiv:2504.07954, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.125750Z"},"links":{"cited_paper":"/paper/2504.07954","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:e41c55b50b36621264fed346e7cdb65f97a95220092e351d0458f0cdccf9342d","observation_id":"d120e7ae-903b-489a-aa89-14f38d5d8a2f","resolution":{"observed_at":"2026-08-07T05:27:05.125750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T05:27:05.129486Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.129486Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:9a8becc1325024c2b0680a27b8928d5e790b90a65d30ce66a9298e0a807c5af0","observation_id":"37fd741a-0b79-46df-9e00-a1c67bf22259","resolution":{"observed_at":"2026-08-07T05:27:05.129486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T05:27:05.133072Z","title":"Visual-rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.133072Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:010e973c00b0cc9173cf34333eb4381febb6a7541051d03a970657e0ac31a350","observation_id":"7679a474-d1ab-4409-abd9-9c4aaa7000b6","resolution":{"observed_at":"2026-08-07T05:27:05.133072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07065","last_updated":"2025-03-10T08:48:50Z","snapshot_observed_at":"2026-08-07T17:17:34.989308Z","submitted_at":"2025-03-10T08:48:50Z","title":"Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07065","snapshot_observed_at":"2026-08-07T05:27:05.136689Z","title":"Boosting the generalization and reasoning of vision language models with curriculum reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.136689Z"},"links":{"cited_paper":"/paper/2503.07065","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:3fe97a83262bf600672934fe956ca41670a145ac3b290aee28274a38e9c0635e","observation_id":"6348801c-8c22-4cb9-8943-fd8dbb1ab974","resolution":{"observed_at":"2026-08-07T05:27:05.136689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-07T17:19:13.101842Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-08-07T05:27:05.140729Z","title":"Seg- zero: Reasoning-chain guided segmentation via cognitive reinforcement.arXiv preprint arXiv:2503.06520, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.140729Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:bd5ad6a306994fab29e36af3c1434464c1e3c15a9f9a110889dca1a8c843047e","observation_id":"22bc375c-4e64-45da-a171-f57595902bb2","resolution":{"observed_at":"2026-08-07T05:27:05.140729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.145217Z","title":"Crowdvlm-r1: Expanding r1 ability to vision language model for crowd counting using fuzzy group relative policy reward.arXiv preprint arXiv:2504.03724, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.145217Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:7614073b93f3bc0cf4a91c0b18668427d45ff01029a1e55c88616d8d6339c1d6","observation_id":"d157d2d5-3671-4249-8e5b-5e86a6654f91","resolution":{"observed_at":"2026-08-07T05:27:05.145217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.148735Z","title":"Reason-rft: Reinforcement fine-tuning for visual reasoning.arXiv preprint arXiv:2503.20752, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.148735Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:b523f299ee425184264784cec50391c5fed526baba99e02b48198bd06332fe63","observation_id":"4217f07e-78ef-41aa-84e8-8aa534724142","resolution":{"observed_at":"2026-08-07T05:27:05.148735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16081","last_updated":"2025-03-28T11:19:21Z","snapshot_observed_at":"2026-08-07T16:49:22.004428Z","submitted_at":"2025-03-20T12:22:18Z","title":"OThink-MR1: Stimulating multimodal generalized reasoning capabilities via dynamic reinforcement learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16081","snapshot_observed_at":"2026-08-07T05:27:05.152302Z","title":"Othink- mr1: Stimulating multimodal generalized reasoning capabilities via dynamic reinforcement learning.arXiv preprint arXiv:2503.16081, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.152302Z"},"links":{"cited_paper":"/paper/2503.16081","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:f895031c4f9096a8fee50576d387535e59a43658e722c2def07a6dced2ccdf2f","observation_id":"5fc15cf8-7aa9-4a9e-8c30-3b2432984ada","resolution":{"observed_at":"2026-08-07T05:27:05.152302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.156233Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.156233Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:f51cc634e39771868e82353a1fcba85956ac47d5dfc7a869607e485d9263f50b","observation_id":"c581d90e-8ee5-493f-9b53-e0e95a7b9f11","resolution":{"observed_at":"2026-08-07T05:27:05.156233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.160052Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.160052Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:503523802037a4c85dae071669f1de61d89a9c0bcaa40a1065fb1e08f824107a","observation_id":"2d04fc18-ed40-4c4a-a6e7-95235979c46f","resolution":{"observed_at":"2026-08-07T05:27:05.160052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.164402Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International journal of computer vision, 123:32–73, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.164402Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:bf2c8a9510b8d5f887f544ef70799cfe9672bd1f89e325df5748d5a943d2e2a0","observation_id":"89861dc0-b9bf-4763-a63b-48c10926ab6c","resolution":{"observed_at":"2026-08-07T05:27:05.164402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.168039Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.168039Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:8684c67cd33754862430d4359dafe15dfad04b347f1326bf0cde7ed73ce13cdb","observation_id":"e381a6a3-9853-40d7-8bf7-9d101078f2ce","resolution":{"observed_at":"2026-08-07T05:27:05.168039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.171480Z","title":"Dual-glance model for deciphering social relationships","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.171480Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:913f008692c21348dd4ed0724581c07268e75c87d5bc164cc11c4a8f3304e24e","observation_id":"8f3867a4-b03c-4462-b451-93b616482945","resolution":{"observed_at":"2026-08-07T05:27:05.171480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.175095Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.175095Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:46d8808db5d3f61f11c6c60a233eef99929ee4ede89c630026004a110625a540","observation_id":"ca7b2491-d32b-4813-98bb-6b7c5dc20abb","resolution":{"observed_at":"2026-08-07T05:27:05.175095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.178737Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.178737Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:2146316c2c4f4be44ddc3897367c5f5bd685290ded29058bdfd5bc876d8d8515","observation_id":"291d4e8a-b359-415c-b459-b6c1c0a85b02","resolution":{"observed_at":"2026-08-07T05:27:05.178737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.181987Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.181987Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:33871fbbf187f75184d05fe6b6a0c1444c110a6420b3fc0de7b8cee58cb5d27a","observation_id":"a10dcfd0-96a0-4c4e-8c9c-f3242c3acade","resolution":{"observed_at":"2026-08-07T05:27:05.181987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T05:27:05.185608Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning.arXiv preprint arXiv:2203.10244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.185608Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:2d9821ebe4390e4ee87be2c66f58ddd100fd6985d546ca696dc302fed9eab8f1","observation_id":"068b58b0-13bb-4fbd-9d9e-84d6034677ae","resolution":{"observed_at":"2026-08-07T05:27:05.185608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.189776Z","title":"An augmented benchmark dataset for geometric question answering through dual parallel text encoding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.189776Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:f0bb4f21fcec8a39bdb0042e6efc40d22bfd8f2c633cf852a793957ff8f07e42","observation_id":"b9aa5595-ee68-44df-bb08-01cfb3932d8d","resolution":{"observed_at":"2026-08-07T05:27:05.189776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.193367Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.193367Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:f7e4ba003f67ed609d0dc450a035f728a184262c7fe034293ad05a1427dec207","observation_id":"7d62ce74-5137-4911-8044-048da7265ebd","resolution":{"observed_at":"2026-08-07T05:27:05.193367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.196950Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.196950Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:2191207edbc18d780df0ba1ca1dbd5b114a9d74a9a0b7181bd9e4d8db8ba6082","observation_id":"b06efcd8-19f4-4144-843f-9821c78a36cc","resolution":{"observed_at":"2026-08-07T05:27:05.196950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05358","last_updated":"2022-08-10T14:08:34Z","snapshot_observed_at":"2026-08-07T21:24:23.287695Z","submitted_at":"2022-08-10T14:08:34Z","title":"CLEVR-Math: A Dataset for Compositional Language, Visual and Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.05358","snapshot_observed_at":"2026-08-07T05:27:05.200325Z","title":"Clevr-math: A dataset for compositional language, visual and mathematical reasoning.arXiv preprint arXiv:2208.05358, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.200325Z"},"links":{"cited_paper":"/paper/2208.05358","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:da9114c2dd680d8026d4e2d1dc30c456c40cd6156dab5ae52e3e68a0422641fd","observation_id":"eabeb259-7914-4223-8ee5-9a69dae88dbc","resolution":{"observed_at":"2026-08-07T05:27:05.200325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.00855","last_updated":"2015-05-05T01:25:26Z","snapshot_observed_at":"2026-07-06T04:16:54.272660Z","submitted_at":"2015-05-05T01:25:26Z","title":"Large-scale Classification of Fine-Art Paintings: Learning The Right Metric on The Right Feature","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.00855","snapshot_observed_at":"2026-08-07T05:27:05.204087Z","title":"Large-scale classification of fine-art paintings: Learning the right metric on the right feature.arXiv preprint arXiv:1505.00855, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.204087Z"},"links":{"cited_paper":"/paper/1505.00855","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:01d932a31348c7b43d42013e889f7c17b3e34d99f716ea9ec2395a5bd4d67b09","observation_id":"6cca9462-d10f-4096-afbf-ed6e80f2ff0e","resolution":{"observed_at":"2026-08-07T05:27:05.204087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.207819Z","title":"Quality at a glance: An audit of web-crawled multilingual datasets.Transactions of the Association for Computational Linguistics, 10:50–72, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.207819Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:598a4dd09adea2a5aebd0ec4a99d13391a07b113d6ffe528f9edc88a84ef4a1c","observation_id":"de39bb08-53f5-4639-9513-e13008944536","resolution":{"observed_at":"2026-08-07T05:27:05.207819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T05:27:05.211152Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.211152Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:30f2569562247452be03620a37f42263133a444695fd2af01bea408e0c21a7f7","observation_id":"453ec9e4-fd2a-452c-b484-b24161f7711f","resolution":{"observed_at":"2026-08-07T05:27:05.211152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T05:27:05.214816Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.214816Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:e03e0e95252bb1f9e9db864e6d165a786e408f6934b7687fedecb9e38e2814b0","observation_id":"2217614f-6fb3-46a2-bb53-017653874857","resolution":{"observed_at":"2026-08-07T05:27:05.214816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.218695Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.218695Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:48f88667b2b15b8d930404f4a7902e28955a79a53e205706deccfc1a8f64913a","observation_id":"31eea80b-7b86-4b09-a24c-f21b2b5d36fa","resolution":{"observed_at":"2026-08-07T05:27:05.218695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.221981Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? InEuropean Conference on Computer Vision, pages 169–186","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.221981Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:ca936167601a045c12eb7d5882bcbfec691c857ab82166f0d6ccc74f6bd0583e","observation_id":"dc998b26-193b-44a7-8a6f-d61669a8b7a9","resolution":{"observed_at":"2026-08-07T05:27:05.221981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00836","last_updated":"2025-02-24T06:55:22Z","snapshot_observed_at":"2026-07-06T19:43:46.557944Z","submitted_at":"2024-10-29T17:29:19Z","title":"DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00836","snapshot_observed_at":"2026-08-07T05:27:05.225253Z","title":"Dynamath: A dynamic visual benchmark for evaluating mathematical reasoning robustness of vision language models.arXiv preprint arXiv:2411.00836, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.225253Z"},"links":{"cited_paper":"/paper/2411.00836","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:68d9ff370b786d27cae7a55d3f65ca6c82c29b801e24f8a51e6c9663d8f70bff","observation_id":"a5bc9403-a0d6-4efd-b92f-bc0e7a252ec1","resolution":{"observed_at":"2026-08-07T05:27:05.225253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-07T05:27:05.229610Z","title":"We-math: Does your large multimodal model achieve human-like mathematical reasoning?arXiv preprint arXiv:2407.01284, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.229610Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:5547be73877d17dfad5ad81c64a3875f67a4002b7209060b4811792b08838b30","observation_id":"d11d3584-06d5-4374-867b-ff60a6a0b96f","resolution":{"observed_at":"2026-08-07T05:27:05.229610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-07T05:27:05.233360Z","title":"Logicvista: Multimodal llm logical reasoning benchmark in visual contexts.arXiv preprint arXiv:2407.04973, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.233360Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:8225b14432a86ddf1b1f250cef1893c5d0bf729cd47471f3f1d25781dfd833dd","observation_id":"2583034b-a82f-497d-8e02-8cfb62091901","resolution":{"observed_at":"2026-08-07T05:27:05.233360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.237152Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.237152Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:d63607d86a8212be51463f7775cab818f1673d0b604a543f4b444d35dd067c7c","observation_id":"7e6b901e-2631-4aa3-8984-2716b6426aa0","resolution":{"observed_at":"2026-08-07T05:27:05.237152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.240629Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.240629Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:8d633ef1e3469774dfcd9abb3a61610de3e74112d6127df080babfb5591c3444","observation_id":"6017241e-0ff7-461c-8c6f-b5ba0517dc04","resolution":{"observed_at":"2026-08-07T05:27:05.240629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T05:27:05.244024Z","title":"Are we on the right way for evaluating large vision-language models?arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.244024Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:154be9d2a574ebd09a1f2ff97ee57bcca618b156416b462f27479994e19469b4","observation_id":"c3dbcfa2-99e2-44f3-b95c-5f8a0ae48840","resolution":{"observed_at":"2026-08-07T05:27:05.244024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.248472Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.248472Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:1677357946e2d5d4e7e9c3c07bd4a6e8e685c50341939ac8cb5770ebb4cdafd3","observation_id":"98464604-acdf-499c-acf3-4e38f8e7e286","resolution":{"observed_at":"2026-08-07T05:27:05.248472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.253190Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models.Science China Information Sciences, 67(12):220102, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.253190Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:552bc35cb7f9a1f7815f49f5f750b40cd850bae0e4d77eaefb2f2e3baf8c33d3","observation_id":"f24ffa82-7d1f-4a5a-818f-553dd3864afa","resolution":{"observed_at":"2026-08-07T05:27:05.253190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.256916Z","title":"Grok-1.5 vision preview: Connecting the digital and physical worlds with our first multimodal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.256916Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:39adf38db30c6ceef7e0a7eaf6996bf4fe081f5140749776699d65b15da8cedd","observation_id":"00d2368b-9ee9-4596-bafa-2c10545d8f6f","resolution":{"observed_at":"2026-08-07T05:27:05.256916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.261384Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.261384Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:8f5ad6b65638002e44d38e99a5da596b4e289f3f6478911646a20fe9d73b5389","observation_id":"fed61cc2-61ea-49e4-bd12-eddbad3687f9","resolution":{"observed_at":"2026-08-07T05:27:05.261384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T05:27:05.265419Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.265419Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:0a4bd9216d240375f2e225e27e738350c08d3af924d558f2a245fc57e7bf5ff2","observation_id":"2c09f3aa-a7bc-4afb-93a0-874cd4d96168","resolution":{"observed_at":"2026-08-07T05:27:05.265419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T05:27:05.269421Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.269421Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:242e318e639cabb5935bbd4d244347f1179ac752646684b1d7158587d044682b","observation_id":"0738cffd-d5a9-412b-a106-c939684827a1","resolution":{"observed_at":"2026-08-07T05:27:05.269421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.273613Z","title":"Easyr1: An efficient, scalable, multi-modality rl training framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.273613Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:40a8db095e259e8b117f44febb682b87cb48c7908e34566a69844648685c6198","observation_id":"dcc8fc6f-9d29-414e-90d5-719c3458ef99","resolution":{"observed_at":"2026-08-07T05:27:05.273613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T05:27:05.277827Z","title":"Vision Only","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.277827Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:4ab2927c1e1270cf07b9be856dd00bebca83ddfbe9817334bbec3382547152cc","observation_id":"40909008-8a02-4e26-98bd-9a1ed8bbe2eb","resolution":{"observed_at":"2026-08-07T05:27:05.277827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:05.282142Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.282142Z"},"links":{"citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:d06968253d43f0d5a8c98dfc3d30f9571eea24882cbf3638ae3a9b55200704aa","observation_id":"522bca22-8ced-4f8f-b805-8fd38471bdb4","resolution":{"observed_at":"2026-08-07T05:27:05.282142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:24:53.935343Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":99,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":125},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 125 outbound references and 8 inbound Pith citation observations for arXiv:2506.07905."}