{"as_of":"2026-08-10T04:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:963c256fda29de2f2594237aeaf3b66b72aa0e66cabd136df2c81d488a00f49f","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:55:15.498636Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:37:19.575834Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:55.331710Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01078","snapshot_observed_at":"2026-08-06T14:37:19.575834Z","title":"Gthinker: Towardsgeneralmultimodalreasoningvia cue-guidedrethinking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18576","last_updated":"2025-08-07T08:02:42Z","snapshot_observed_at":"2026-08-08T02:00:15.105327Z","submitted_at":"2025-07-24T16:49:19Z","title":"SafeWork-R1: Coevolving Safety and Intelligence under the AI-45$^{\\circ}$ Law","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T14:37:19.575834Z"},"links":{"cited_paper":"/paper/2506.01078","citing_paper":"/paper/2507.18576"},"observation_digest":"sha256:d166a4632ab51818a754bd1c70898d211856ab0c103f6923faec125dcadb1c9c","observation_id":"9bf62d37-bacf-46c9-9528-1e292c4f2fe2","resolution":{"observed_at":"2026-08-06T14:37:19.575834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"cited_work":{"arxiv_id":"2506.01078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01078","snapshot_observed_at":"2026-07-04T15:09:55.331710Z","title":"Gthinker: Towards general multimodal reasoning via cue-guided rethinking","venue":null,"work_id":"e1f4749e-feb8-4358-8fe2-42af07d999c5","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":240,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2506.01078","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:2164ecb1685619385923de80fa619844a4d91d0283f497ef25cf4cd614ad3836","observation_id":"51434a38-27d4-4cdd-9a2e-fd34b8e95e25","resolution":{"observed_at":"2026-05-18T19:21:48.600332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01078","snapshot_observed_at":"2026-08-04T16:07:46.730039Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":234,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:46.730039Z"},"links":{"cited_paper":"/paper/2506.01078","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:9bf65a50de7b79c8ffa498c0b0d9374e43d7afb9da66318a12d2610e92cc940a","observation_id":"74e75a2a-7660-4070-9f2a-35d038cf8ac1","resolution":{"observed_at":"2026-08-04T16:07:46.730039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"cited_work":{"arxiv_id":"2506.01078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01078","snapshot_observed_at":"2026-07-04T15:09:55.331710Z","title":"Gthinker: Towards general multimodal reasoning via cue-guided rethinking","venue":null,"work_id":"e1f4749e-feb8-4358-8fe2-42af07d999c5","year":2025},"citing_paper":{"arxiv_id":"2604.24339","last_updated":"2026-04-27T11:31:15Z","snapshot_observed_at":"2026-07-06T23:10:24.992210Z","submitted_at":"2026-04-27T11:31:15Z","title":"See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-08T04:46:16.497585Z"},"links":{"cited_paper":"/paper/2506.01078","citing_paper":"/paper/2604.24339"},"observation_digest":"sha256:1b8da783e9877e36a8280b975c420416f14480ab3fd114583db7df298f7c4590","observation_id":"3b5c11b0-909c-4144-9dbe-7e7e7e6e00a9","resolution":{"observed_at":"2026-05-11T21:36:17.576402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"cited_work":{"arxiv_id":"2506.01078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01078","snapshot_observed_at":"2026-07-04T15:09:55.331710Z","title":"Gthinker: Towards general multimodal reasoning via cue-guided rethinking","venue":null,"work_id":"e1f4749e-feb8-4358-8fe2-42af07d999c5","year":2025},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2506.01078","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:d9c208cd0ffe6e1cc2f9b7bfd88bb54ffd9e2adc1512b4dbc3eee83d65ec84bf","observation_id":"8160789e-f389-48e2-ab36-3b6de0efeffc","resolution":{"observed_at":"2026-05-20T05:13:21.576609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"cited_work":{"arxiv_id":"2506.01078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01078","snapshot_observed_at":"2026-07-04T15:09:55.331710Z","title":"Gthinker: Towards general multimodal reasoning via cue-guided rethinking","venue":null,"work_id":"e1f4749e-feb8-4358-8fe2-42af07d999c5","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":217,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2506.01078","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:8a9fb44f0f69394009d2c5077783bceb11eb9fd485f6a96c9280de59590c45b2","observation_id":"4ea4b481-5c01-42f1-8ad5-12453ff09425","resolution":{"observed_at":"2026-07-04T15:09:55.333992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01078/citation-record","integrity":"/paper/2506.01078/integrity","json":"/paper/2506.01078/citation-record.json","paper":"/paper/2506.01078"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:55:11.774631Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:11.774631Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:638e0ef9ab01a6d02ab7ca2c89a34938d127887040024117c06164950172c18a","observation_id":"aa0bce29-ef9c-4bd5-901f-3e684ab67a49","resolution":{"observed_at":"2026-08-07T11:55:11.774631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T11:55:11.821566Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:11.821566Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:8a83b7c277d8f5a2a624e864a74089be34dd68c8fcc55847a1e159dea4b287c2","observation_id":"12445f70-6053-460c-9e82-f2362571e48e","resolution":{"observed_at":"2026-08-07T11:55:11.821566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-07-31T23:26:05.255316Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-08-07T11:55:11.856611Z","title":"Perception tokens enhance visual reasoning in multimodal language models.arXiv preprint arXiv:2412.03548, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:11.856611Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:dd80ca924794bea3e79a15b13cf4a88be4f94be4b51343b9d370b825f42cbe86","observation_id":"38f64302-aa0c-470f-99a1-8791e16daa41","resolution":{"observed_at":"2026-08-07T11:55:11.856611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-07T11:55:11.906301Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models.arXiv preprint arXiv:2504.11468, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:11.906301Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:b66a9ba852403cb5234474d99dea823a778cbebe62e69f6b81bb49f30ba9cea7","observation_id":"9ecec8f3-af2c-44e1-964e-f995accd4dbc","resolution":{"observed_at":"2026-08-07T11:55:11.906301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:11.930951Z","title":"Are we on the right way for evaluating large vision-language models? InThe Thirty-eighth Annual Conference on Neural Information Processing Systems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:11.930951Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:75202a8e03ff42d0a128cb27bc681eb4f17a53a32eafa7e152614bc08c7ef212","observation_id":"023d15c5-a23f-41eb-9564-d013bc58a441","resolution":{"observed_at":"2026-08-07T11:55:11.930951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:11.969152Z","title":"R1-v: Reinforcing super generalization ability in vision-language models with less than $3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:11.969152Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:66c227692189d6e5f12c0c7fb92c06374eb580dbe4fb9edec859b2730e1acf62","observation_id":"ebac17ce-1efc-4864-8848-c04bf13502bd","resolution":{"observed_at":"2026-08-07T11:55:11.969152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-09T14:34:23.303061Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T11:55:12.014182Z","title":"M3cot: A novel benchmark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.014182Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:d78b074d26954c069cfff9c612cc96675b4966650de5f9e78e820a0d835b8173","observation_id":"c9ff8af9-fef5-462a-8545-4a856cbd90e8","resolution":{"observed_at":"2026-08-07T11:55:12.014182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:12.061180Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.061180Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:cf6d26d3ca973f5520169b20b26e2e937f20d63ddcd25b2487f1122178dc191c","observation_id":"b0a05cc2-2c03-4da4-bf31-5f88bf5219d4","resolution":{"observed_at":"2026-08-07T11:55:12.061180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:12.108675Z","title":"Gemini 2.5 pro preview model card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.108675Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:c7e11a700f4b4cc2eabcdded8ddae124d2bfd1c97f48028f47f39716528139e2","observation_id":"4d17a14d-d0f8-4327-9080-26d7492ad706","resolution":{"observed_at":"2026-08-07T11:55:12.108675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01904","last_updated":"2025-02-05T09:17:01Z","snapshot_observed_at":"2026-08-08T00:29:08.656523Z","submitted_at":"2025-01-03T17:14:16Z","title":"Virgo: A Preliminary Exploration on Reproducing o1-like MLLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01904","snapshot_observed_at":"2026-08-07T11:55:12.149124Z","title":"Virgo: A preliminary exploration on reproducing o1-like mllm.arXiv preprint arXiv:2501.01904, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.149124Z"},"links":{"cited_paper":"/paper/2501.01904","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:02d96a64e4cc3514af1e4a0263b9295ddcb554586e2472116df50f4597d58175","observation_id":"f1e0314c-df3b-4a52-8752-6ab3de98c9fb","resolution":{"observed_at":"2026-08-07T11:55:12.149124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:12.213124Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.213124Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:25a9aefdab19ac125c349530d48944f50b7fcdeea6424cf93fac6c9575d2822f","observation_id":"d879ea55-65b0-4411-9b04-86a11e4af277","resolution":{"observed_at":"2026-08-07T11:55:12.213124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:19.375185Z","title":"Cantor: Inspiring multimodal chain-of-thought of mllm","venue":null,"work_id":"6947de4e-0826-416b-8fd4-6eaf6fd0c728","year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.262102Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:fca33222865f569018027f0fac80cb71f5a2e99363975f74e35660d9632ac816","observation_id":"c25cc8e7-7529-47dc-9568-0ef4fd50a058","resolution":{"observed_at":"2026-08-07T11:55:19.465045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:55:12.301566Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.301566Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:0a780fa5b3a51a97dcceb19220281ccfc06a49bad1f88fe4e7d14fe0128c0793","observation_id":"f24ee158-fd32-435c-8c58-fa50cdb828ab","resolution":{"observed_at":"2026-08-07T11:55:12.301566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:19.238878Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":"51a16183-739c-4b34-a56c-d408ebc9e4f2","year":2021},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.345211Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:c553e8899d0f22846c7fd5eae50e7aaa807d16c701e77c46de40a17d27c52bd5","observation_id":"5021add6-3abe-4e19-9a91-c1f21a66fc32","resolution":{"observed_at":"2026-08-07T11:55:19.290620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:19.091762Z","title":"The abduction of sherlock holmes: A dataset for visual abductive reasoning","venue":null,"work_id":"f72d7a05-55db-4e58-b5c4-bf3abd5e5116","year":2022},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.398632Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:691a1dc0a606b860864fa5679404b5fd058f12765f96715f337a31472e811477","observation_id":"7efaa70e-e358-41cc-8c91-60c873221cd6","resolution":{"observed_at":"2026-08-07T11:55:19.168420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T11:55:12.450962Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models.arXiv preprint arXiv:2503.06749, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.450962Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:ee42266687eb22cb17a8ee80e5a22ffa4757dda7affbeb0adaadf5f200a6e815","observation_id":"f35b0048-75c2-496e-b003-074ef2392571","resolution":{"observed_at":"2026-08-07T11:55:12.450962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T11:55:12.506068Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.506068Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:c8a37333d9a245cc86fb80be6e238a38c166c6d00a9d7cd7a91f0bbd66528be1","observation_id":"e41420bb-eee7-4219-a427-1d2970955726","resolution":{"observed_at":"2026-08-07T11:55:12.506068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:18.931601Z","title":"Math-Verify: Math Verification Library, 2023","venue":null,"work_id":"82a4719a-023f-4ae8-bd18-da0e72cd1147","year":2023},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.549003Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:a0f95c57910b7aded43bc4b7379b2c285a4a6cf73ecef77727499fa462d3093c","observation_id":"11301c7e-0e1d-476e-9355-b371fd77dd1b","resolution":{"observed_at":"2026-08-07T11:55:19.006825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T11:55:12.601005Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.601005Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:6c606451fedd1d19dfcefae01500dec6759b19f19500403abbb53c5fcecbd863","observation_id":"7e1d0daf-db50-469e-be9e-1c0f31cb1850","resolution":{"observed_at":"2026-08-07T11:55:12.601005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:18.737992Z","title":"Abstract visual reasoning with tangram shapes","venue":null,"work_id":"dc460c9d-44e0-471f-8337-2f6f6feea3c3","year":2022},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.636382Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:9a37cec3d7a39e056e4cbd00a153455b39e640fbf3de594f2d98273732f27701","observation_id":"46c18466-ed5b-4404-b7fc-2097d1c65101","resolution":{"observed_at":"2026-08-07T11:55:18.814552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:18.557740Z","title":"Dcot: Dual chain-of-thought prompting for large multimodal models","venue":null,"work_id":"abb20c1e-2537-4341-9b50-1977ff6f38c3","year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.689346Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:2940f28ac6826a1041b42a83d95136193dcdaaf30ce4f6c7e8d4104763403092","observation_id":"e0ac755b-9f00-462d-ab09-3b38b42ce4ec","resolution":{"observed_at":"2026-08-07T11:55:18.642575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T11:55:12.734446Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.734446Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:9407bd9071f92e9d0839a6ba47042f4d6862e8f7a75b223ea1a34752967a3d96","observation_id":"3b2c1749-b529-46e6-b946-27af2bc38d7e","resolution":{"observed_at":"2026-08-07T11:55:12.734446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-07T11:55:12.792022Z","title":"Silkie: Preference distillation for large visual language models.arXiv preprint arXiv:2312.10665, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.792022Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:ca7ea72aae27646a695ca8d292a388532940e626668526985dc1c5c6af04170a","observation_id":"0eb33f72-d27a-4a76-930a-3606de24e0fc","resolution":{"observed_at":"2026-08-07T11:55:12.792022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16919","last_updated":"2025-03-08T17:16:09Z","snapshot_observed_at":"2026-08-08T23:08:12.291486Z","submitted_at":"2024-05-27T08:12:00Z","title":"VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16919","snapshot_observed_at":"2026-08-07T11:55:12.887272Z","title":"V ocot: Unleashing visually grounded multi-step reasoning in large multi-modal models.arXiv preprint arXiv:2405.16919, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.887272Z"},"links":{"cited_paper":"/paper/2405.16919","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:98a92c860caab83bc6b087dea567cbd60e76fae9d58763abef9bf0db810cda28","observation_id":"62f27d10-92d2-4000-9c11-92909d519264","resolution":{"observed_at":"2026-08-07T11:55:12.887272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17451","last_updated":"2025-06-06T10:36:59Z","snapshot_observed_at":"2026-08-09T10:47:38.920946Z","submitted_at":"2024-12-23T10:18:41Z","title":"Diving into Self-Evolving Training for Multimodal Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17451","snapshot_observed_at":"2026-08-07T11:55:12.938364Z","title":"Diving into self-evolving training for multimodal reasoning.arXiv preprint arXiv:2412.17451, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.938364Z"},"links":{"cited_paper":"/paper/2412.17451","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:8619c5795a33031758592b8032db112b509828cbec674218f0f1ba3c0150d77d","observation_id":"1208e7d4-dfad-4aa9-ba0d-592b73ae6df9","resolution":{"observed_at":"2026-08-07T11:55:12.938364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-08-07T11:55:12.978031Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models.arXiv preprint arXiv:2403.12966, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.978031Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:93f9a91d512eb4665aa811d18689919365e6d70c8f97f7a87e5e4037c953d726","observation_id":"3194040f-a74e-4226-818d-3234125cc836","resolution":{"observed_at":"2026-08-07T11:55:12.978031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:18.484808Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":"bd6b7d0d-b791-4fff-b1b1-46712c15b8b7","year":null},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.031238Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:65a2488622821a4cac2e1d3221b4b368320c51bf808093c5957940e2f10084a1","observation_id":"d0bb0f6b-b5c6-47ba-b795-aefcf70039dd","resolution":{"observed_at":"2026-08-07T11:55:18.510804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:13.090908Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.090908Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:e9fbfcfdae779e588e12e837d88128119596e789c158b502c9da225004156109","observation_id":"e43b2e78-e870-4fba-83c5-a9fc52b45e50","resolution":{"observed_at":"2026-08-07T11:55:13.090908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:18.371741Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning","venue":null,"work_id":"06c80392-bd08-42c8-8adc-76f575e3b9c8","year":2022},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.159210Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:d1df47d52229262eea8c30e2ac3c7d0d98e509c63f01f9653e3bb6c81fcc0fd5","observation_id":"baf9e354-97f7-452c-aeb2-9d34a4aef0c0","resolution":{"observed_at":"2026-08-07T11:55:18.438773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-07T21:47:16.436942Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-07T11:55:13.202412Z","title":"Ovis: Structural embedding alignment for multimodal large language model.arXiv:2405.20797, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.202412Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:efe8dccf136d82b57d55bbb1d52aa199ca86189af4bb5251e572e0c0b143cb27","observation_id":"f3ea50c4-9b66-4532-954b-befd96fe0118","resolution":{"observed_at":"2026-08-07T11:55:13.202412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09797","last_updated":"2024-04-15T13:54:35Z","snapshot_observed_at":"2026-08-09T19:46:42.652537Z","submitted_at":"2024-04-15T13:54:35Z","title":"TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09797","snapshot_observed_at":"2026-08-07T11:55:13.230798Z","title":"Textcot: Zoom in for enhanced multimodal text-rich image understanding.arXiv preprint arXiv:2404.09797, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.230798Z"},"links":{"cited_paper":"/paper/2404.09797","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:ed695646e72662037860cc5f3f9dd14e07bff0560c744ee5c0e0bc77e5922a8c","observation_id":"768f4ee9-819d-409a-82a3-6511bcca86bf","resolution":{"observed_at":"2026-08-07T11:55:13.230798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T11:55:13.261487Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning.arXiv preprint arXiv:2503.07365, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.261487Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:6d95495dd68c702272b7d77e1668116e197bea85a592279f06622e83ed3f9850","observation_id":"85d412e4-cd40-4c36-8b56-4669993426c0","resolution":{"observed_at":"2026-08-07T11:55:13.261487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:18.221347Z","title":"Compositional chain-of-thought prompting for large multimodal models","venue":null,"work_id":"6098cd28-2375-4629-b022-c41a83e99a21","year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.311730Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:a4507586d289910435488e40e6a2756d68df6121008ac1b726d6d5fc8aa94076","observation_id":"86254fe8-b730-415d-851c-388c2eae1875","resolution":{"observed_at":"2026-08-07T11:55:18.282182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:18.142038Z","title":"O3 and o4-mini system card","venue":null,"work_id":"e6a72e5a-e12e-4316-8fe8-ed203413df2f","year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.342588Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:1145f9112c27bf48998fac4ecc7aeef16978c74a0ec9f50b6f5ebaebd447d26d","observation_id":"d1e06d9c-a647-4703-aa0f-1712997adb57","resolution":{"observed_at":"2026-08-07T11:55:18.169036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05599","last_updated":"2025-06-09T11:44:18Z","snapshot_observed_at":"2026-08-09T12:50:50.767642Z","submitted_at":"2025-04-08T01:19:20Z","title":"Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05599","snapshot_observed_at":"2026-08-07T11:55:13.380294Z","title":"Skywork r1v: Pioneering multimodal reasoning with chain-of-thought.arXiv preprint arXiv:2504.05599, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.380294Z"},"links":{"cited_paper":"/paper/2504.05599","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:d2f61e2cdd41020b890326dbcc38b6a898c70d484574f33e6848e7170dbf5c25","observation_id":"d2cd426f-ae60-4c5b-a659-a910706b907c","resolution":{"observed_at":"2026-08-07T11:55:13.380294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18982","last_updated":"2024-10-08T15:13:01Z","snapshot_observed_at":"2026-07-06T19:39:15.025945Z","submitted_at":"2024-10-08T15:13:01Z","title":"O1 Replication Journey: A Strategic Progress Report -- Part 1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18982","snapshot_observed_at":"2026-08-07T11:55:13.434001Z","title":"O1 replication journey: A strategic progress report–part 1.arXiv preprint arXiv:2410.18982, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.434001Z"},"links":{"cited_paper":"/paper/2410.18982","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:7cd647c0c38ea717c2bd47c47b4a8612316d963ceea5cdffb3132f6b4bfa14a0","observation_id":"7f4e8530-e3d7-4994-a8a2-82b77e6730e9","resolution":{"observed_at":"2026-08-07T11:55:13.434001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:13.463903Z","title":"Direct preference optimization: Your language model is secretly a reward model.Advances in Neural Information Processing Systems, 36:53728–53741, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.463903Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:0e01839671cd2268dca0de24c63513370707d8d9a75a2402261ba8cb24c99787","observation_id":"7b8c2e92-d821-40c1-b36f-71bedf13125f","resolution":{"observed_at":"2026-08-07T11:55:13.463903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04022","last_updated":"2025-04-05T02:24:07Z","snapshot_observed_at":"2026-08-07T21:53:41.208900Z","submitted_at":"2025-04-05T02:24:07Z","title":"Rethinking Reflection in Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04022","snapshot_observed_at":"2026-08-07T11:55:13.515733Z","title":"Rethinking reflection in pre-training.arXiv preprint arXiv:2504.04022, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.515733Z"},"links":{"cited_paper":"/paper/2504.04022","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:f94bc71475b2e4533ec8a3fe223be12caae06dab6fb4d136e12f91e0c630c0a9","observation_id":"c6d3d20f-5991-4e78-8cee-5c35904d0653","resolution":{"observed_at":"2026-08-07T11:55:13.515733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:13.537018Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.537018Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:28465464acc356ba4e18b894b10cbdff63453a402805c9af7b284783e1ec7322","observation_id":"9ab4e716-36fc-488d-9445-0b2094067eea","resolution":{"observed_at":"2026-08-07T11:55:13.537018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T11:55:13.586726Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.586726Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:937084a64c95087590497530c554bdc6dd057a33aa6a875b1c6c7491a04acd00","observation_id":"c9f8922b-8b8f-40fb-ad7f-a5e4a598770b","resolution":{"observed_at":"2026-08-07T11:55:13.586726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-07T11:55:13.667498Z","title":"Aligning large multimodal models with factually augmented rlhf.arXiv preprint arXiv:2309.14525, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.667498Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:12078c0774511acbcbaff6bac2e53c5355c124e36bee335a93d99e273568e027","observation_id":"983461eb-e95b-4f81-bc9b-e7161ec4e2e9","resolution":{"observed_at":"2026-08-07T11:55:13.667498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-09T09:48:45.884814Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-07T11:55:13.706010Z","title":"Kimi-vl technical report.arXiv preprint arXiv:2504.07491, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.706010Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:71133d2b09ffc9aa9ec411f8f63f4161a2bf417437bf35694c26ccf210fac80f","observation_id":"9623ce81-8064-42c0-b353-2e803c167ba6","resolution":{"observed_at":"2026-08-07T11:55:13.706010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:13.751900Z","title":"Qwq-32b: Embracing the power of reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.751900Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:108b06d0eac0be216b89cb305a34acb72329fa5a1cebe8a4f3d85d7beac86eb9","observation_id":"443fff95-c174-4f1b-b701-1aa212e2e4d1","resolution":{"observed_at":"2026-08-07T11:55:13.751900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-07T11:55:13.783825Z","title":"Llamav-o1: Rethinking step-by-step visual reasoning in llms.arXiv preprint arXiv:2501.06186, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.783825Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:9fd96059f116736894da9a4d7e25be419941d38e54f5f10d064875f9d8cfa39e","observation_id":"cf62bded-4187-46b7-9d7e-cff9c6edfacc","resolution":{"observed_at":"2026-08-07T11:55:13.783825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15613","last_updated":"2024-06-28T09:22:38Z","snapshot_observed_at":"2026-07-06T18:19:25.869339Z","submitted_at":"2024-05-24T14:58:51Z","title":"Automatic Data Curation for Self-Supervised Learning: A Clustering-Based Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15613","snapshot_observed_at":"2026-08-07T11:55:13.815176Z","title":"Automatic data curation for self-supervised learning: A clustering-based approach.arXiv preprint arXiv:2405.15613, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.815176Z"},"links":{"cited_paper":"/paper/2405.15613","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:32e846f444b2867899ef2e96713eef46276f4b94267d0ae26a33d0a29e8b99b3","observation_id":"9a19dd4a-05ab-423d-8799-5b2d39bfd03e","resolution":{"observed_at":"2026-08-07T11:55:13.815176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:13.847422Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset.Advances in Neural Information Processing Systems, 37:95095–95169, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.847422Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:9c5088c0692bdfee74b89d534c6b3fc3fabb1aa1cd3fd06b1b9d5492787fb2e8","observation_id":"7e2bbec1-3765-486d-be83-792e41dc3a9c","resolution":{"observed_at":"2026-08-07T11:55:13.847422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-07T11:55:13.922969Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization.arXiv preprint arXiv:2411.10442, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.922969Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:5c5fe11bfc2198ca3c2cde4dc28142eeb433eed0739c27d3c3817a8bd1a883b9","observation_id":"db4734aa-bd8f-48fb-8b6d-ad871887ec71","resolution":{"observed_at":"2026-08-07T11:55:13.922969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10291","last_updated":"2025-03-13T12:03:37Z","snapshot_observed_at":"2026-08-07T21:25:47.268391Z","submitted_at":"2025-03-13T12:03:37Z","title":"VisualPRM: An Effective Process Reward Model for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10291","snapshot_observed_at":"2026-08-07T11:55:13.976791Z","title":"Visualprm: An effective process reward model for multimodal reasoning.arXiv preprint arXiv:2503.10291, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.976791Z"},"links":{"cited_paper":"/paper/2503.10291","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:eac2bdc97a3d8826ab5c382f07a8f5b79644922abb8588a360de317fec69a32a","observation_id":"a17f981c-2931-4cd4-a188-00780aeb2972","resolution":{"observed_at":"2026-08-07T11:55:13.976791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:14.016315Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.016315Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:4f8db035335ee89b56b307c18ef12b576707f83122aa5c3ea40207ef5e7038e7","observation_id":"af52cd2a-3648-4a19-8272-91c349c85350","resolution":{"observed_at":"2026-08-07T11:55:14.016315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:14.047663Z","title":"V?: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.047663Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:3ff68618af6a5887fe7b3caed39a61b93bb2f9a419a1b7cbc013c91ccab5a47c","observation_id":"be5d73bb-39cd-4d6c-9ab7-4903ac947a3b","resolution":{"observed_at":"2026-08-07T11:55:14.047663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-07T11:55:14.082910Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding.arXiv preprint arXiv:2412.10302, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.082910Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:d775a56aba5c0923a7df8e332324b17422cff09ca4be72b0a961771c28ea740c","observation_id":"6f645a90-1413-4158-bc97-bd2620bea1e5","resolution":{"observed_at":"2026-08-07T11:55:14.082910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-08T08:03:26.182607Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05901","snapshot_observed_at":"2026-08-07T11:55:14.123082Z","title":"Valley2: Exploring multimodal models with scalable vision-language design.arXiv preprint arXiv:2501.05901, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.123082Z"},"links":{"cited_paper":"/paper/2501.05901","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:7acbf5e187d4aae493ea03fedcbab34486ec668c028ef12f7a9f52af6fd1ca1c","observation_id":"f7ffcbb5-699a-45e6-a7b4-69e78ef5f9e6","resolution":{"observed_at":"2026-08-07T11:55:14.123082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:18.016303Z","title":"Grok-1.5 vision preview.https://x.ai/blog/grok-1.5v, 2024","venue":null,"work_id":"9fff0766-65d3-4309-b08c-c51f430168e9","year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.154557Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:3f99587acdb04a04eda59343fbe805f6a24a088688a7f5f7febc3e9b3e6a4217","observation_id":"325687c6-cd93-4575-9e89-36946bb2e03e","resolution":{"observed_at":"2026-08-07T11:55:18.044283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T11:55:14.196592Z","title":"Llava-o1: Let vision language models reason step-by-step.arXiv preprint arXiv:2411.10440, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.196592Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:d28eeec6e282c75f40a056952719cd400435c7fc4eac6519afd12f23e3ea3456","observation_id":"8216b34c-7b24-4c7d-b699-180713ba760f","resolution":{"observed_at":"2026-08-07T11:55:14.196592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-07T11:55:14.243341Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization.arXiv preprint arXiv:2503.10615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.243341Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:f821f6c2b624fe93e5487fe7dd5ffc55ab56133e5367dcf050e97a6e0d00d85e","observation_id":"ef1a0837-1386-407b-829c-63f946f193cb","resolution":{"observed_at":"2026-08-07T11:55:14.243341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-10T00:19:13.518873Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-08-07T11:55:14.280040Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search.arXiv preprint arXiv:2412.18319, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.280040Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:5223d575f15b92f372b978b26e513f9801200e73a3c803daf8d7fd6913b3324d","observation_id":"126c7a05-0e26-4e47-af71-db622ff377b7","resolution":{"observed_at":"2026-08-07T11:55:14.280040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:14.320981Z","title":"Tree of thoughts: Deliberate problem solving with large language models.Advances in neural information processing systems, 36:11809–11822, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.320981Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:a7bae6824f69b31d3ca4a226ac667556d0694402f92bd95c7365cc26c1c7fa3c","observation_id":"5cb9a2fa-18d6-447e-a62d-cf036c3f1d21","resolution":{"observed_at":"2026-08-07T11:55:14.320981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T11:55:14.363044Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.363044Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:191e66a1a3316b21df3afe2def0b1c480d53ec5329bfec1022085eafa583210d","observation_id":"f2a6f081-263a-452c-8fcf-e02f9268efb1","resolution":{"observed_at":"2026-08-07T11:55:14.363044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:14.405560Z","title":"Rlaif-v: Aligning mllms through open-source ai feedback for super gpt-4v trustworthiness.arXiv preprint arXiv:2405.17220, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.405560Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:a0e6a0b9089909455a52038c89e6f0129c9f754902a120fca4fee9bf52c84530","observation_id":"be287d4e-fbca-4dcb-bccf-494b8b5b684d","resolution":{"observed_at":"2026-08-07T11:55:14.405560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-07T11:55:14.467663Z","title":"Mmmu-pro: A more robust multi-discipline multimodal understanding benchmark.arXiv preprint arXiv:2409.02813, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.467663Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:df27725df8bfce9c99a9395a6aa4bc543217acc696d76764834f9a7b60ad87ce","observation_id":"eba62b12-8943-4eb0-90cc-1e83da13778c","resolution":{"observed_at":"2026-08-07T11:55:14.467663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.862546Z","title":"Griffon: Spelling out all object locations at any granularity with large language models","venue":null,"work_id":"4a42d0f7-9a77-4017-aadc-7c957f5939a0","year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.511694Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:9b5c7177c037cabb1fdf4d425d84a2df00a0fd601a3c5608e3e3d5e42747f5e3","observation_id":"5fc1b220-d50f-4c6e-8177-b57b88ed8c5e","resolution":{"observed_at":"2026-08-07T11:55:17.944518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.711757Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models","venue":null,"work_id":"7d044aea-78b6-467b-8468-ed51504c2c0d","year":null},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.559871Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:0f2743f8327ec75292d32da3bfad14af3d0366f1e54a1c15917b54ef88aa96b6","observation_id":"2d6a7a05-c0da-436e-bf2d-44ed9fd03936","resolution":{"observed_at":"2026-08-07T11:55:17.766547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-08-08T03:30:51.616377Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-07T11:55:14.605390Z","title":"Improve vision language model chain-of-thought reasoning.arXiv preprint arXiv:2410.16198, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.605390Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:e0878aa8605a4f56d4bdcfd78b20b933e53a789cf238d1637d9bf79c6091dcc8","observation_id":"9d312232-0a92-41c3-a7d8-a8b6e7113e02","resolution":{"observed_at":"2026-08-07T11:55:14.605390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-08T01:23:11.364463Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-07T11:55:14.660602Z","title":"Spa-vl: A comprehensive safety preference alignment dataset for vision language model.arXiv preprint arXiv:2406.12030, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.660602Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:c45e27e77579488e345df0c3985042484e224299154e25289d46a0a48486cbff","observation_id":"4a5719e8-17ef-4d2f-994f-0806687c0102","resolution":{"observed_at":"2026-08-07T11:55:14.660602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-08T01:24:46.892879Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-07T11:55:14.702270Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment.arXiv preprint arXiv:2502.10391, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.702270Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:ce1bf94d5e0ff1676847d2e8411ba60f960f4f8f410b3cd2ebc89feeb36ba383","observation_id":"af67a684-595c-4119-b025-89b1851ed955","resolution":{"observed_at":"2026-08-07T11:55:14.702270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T11:55:14.744601Z","title":"Multimodal chain-of-thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.744601Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:5783ee79078485c8716d16fe3a14a7201524900d67e4d30a598c1180428419a9","observation_id":"5e94eb29-f3b2-481f-9344-cd4227812f63","resolution":{"observed_at":"2026-08-07T11:55:14.744601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:14.808518Z","title":"Ddcot: Duty-distinct chain-of-thought prompting for multimodal reasoning in language models.Advances in Neural Information Processing Systems, 36:5168–5191, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.808518Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:cdee80bda69a32c4cda6ba611ac01e47068b56b53ad4c1a5b5384ddf36f1fd01","observation_id":"b61ee54b-df04-4705-99f2-a932e7f313c4","resolution":{"observed_at":"2026-08-07T11:55:14.808518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T11:55:14.847482Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.847482Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:a9915b47440fe3036918e59b93cb472ab388c9e432dfb9a9e44fd8009cf58083","observation_id":"ab1a015a-c659-4ae2-979b-d101bc05bf37","resolution":{"observed_at":"2026-08-07T11:55:14.847482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.597046Z","title":null,"venue":null,"work_id":"7e12d23d-9038-442a-9e8a-d26e94272dc9","year":null},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.880283Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:cd887cef06ea9ee01e67fc8ce1ac8b77980c3e70f83cfb6372c1d6b30bd7073d","observation_id":"154118fb-2756-4d03-a647-3194e61ddeed","resolution":{"observed_at":"2026-08-07T11:55:17.641879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.505660Z","title":null,"venue":null,"work_id":"f171d267-34c5-4c49-bc5f-fc4d26650714","year":null},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.915753Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:d062cbb6ff2d3c07dbc71401ce2ccad3e62946bb8a66ec1916cf1d12efbbcc3f","observation_id":"49b668c6-1839-40b1-b341-9a14a4da1826","resolution":{"observed_at":"2026-08-07T11:55:17.545042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.420573Z","title":null,"venue":null,"work_id":"f2176423-f28d-4704-949f-0d37b1c83c2d","year":null},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.970907Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:3ab568274f7ec63b82f74b5697ad1f9c5aada873aaef02f3a409a63e61c618b7","observation_id":"8b139858-c0d0-47db-92a4-2475a2512a97","resolution":{"observed_at":"2026-08-07T11:55:17.460148Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.339138Z","title":"model’s chain-of-thought (CoT)","venue":null,"work_id":"a14470c6-0f10-45a8-922c-ae6d9be11e7b","year":null},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:15.015345Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:023e814bd99605f3560656a00ef76b751a9f3a6b9a9c01ba2487e0c12221baf5","observation_id":"3bb65ca0-0f86-4c04-9581-9da1db0c5bde","resolution":{"observed_at":"2026-08-07T11:55:17.375472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.247107Z","title":"- Then, wrap the model’s entire thought process in <think></think>","venue":null,"work_id":"0c1569c9-c211-4d03-8c41-bc7a13253dfc","year":null},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:15.075607Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:9c758b510d591da8c69f9b7425713915acafe2f61e4e655f34b897c3d9ec9d54","observation_id":"0337b9b7-4972-4951-80b1-eb404c4cef5c","resolution":{"observed_at":"2026-08-07T11:55:17.288363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.175905Z","title":"<vcues_1>, <vcues_2>,","venue":null,"work_id":"40a99b63-a3bd-4536-a9e0-69c96f7c6f46","year":null},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:15.125236Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:e055a97634fd0f65825d667e0e3c0f25ef5c5e6211f1c5903969dd87ec1c140c","observation_id":"03b5c2e2-ab2a-49f7-85a9-c3c61f023780","resolution":{"observed_at":"2026-08-07T11:55:17.211611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.111250Z","title":"All the data to be processed now concern reasoning errors based on visual cues rather than errors in visual cue perception","venue":null,"work_id":"2048a001-ec31-43ea-b0c7-bd00b8457dd7","year":null},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:15.156197Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:a6f227f2e44f3d895bf722cc498b68b5d4f6fd0919b6771ad17fb25b258f1679","observation_id":"92a74542-590d-4e50-a054-f3ad6876cce2","resolution":{"observed_at":"2026-08-07T11:55:17.139294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.028090Z","title":"based on the rationale","venue":null,"work_id":"533ca9d5-e3eb-488f-974d-6ad57abfea96","year":null},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:15.182656Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:ee78b3f796be9005cabd59e22886afbe82b6c4d33e0fa830ea21e792c362a8be","observation_id":"b2715fd1-294c-463c-987c-a6d13ec84414","resolution":{"observed_at":"2026-08-07T11:55:17.067581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:16.946171Z","title":null,"venue":null,"work_id":"0cc0a090-7e07-42d5-980e-4b437addee92","year":null},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:15.223161Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:b1a761adc5def2838b0069b97392a719e06326e276ecaaf139b8edf4e49a59eb","observation_id":"9abc4366-1090-4d11-b7c8-1a1192610bac","resolution":{"observed_at":"2026-08-07T11:55:16.981376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:16.877482Z","title":null,"venue":null,"work_id":"80baa245-faee-473b-a658-cee9650a5d91","year":null},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:15.258999Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:1d8d1edff80777ebb1ce87d02a250416f48f124d398aca4b3f1e2003495aa245","observation_id":"b3501fb9-f946-451a-ae49-8aa9c067f709","resolution":{"observed_at":"2026-08-07T11:55:16.906529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:16.794196Z","title":null,"venue":null,"work_id":"0dd26a7b-977f-4462-b258-bd3d14bc4268","year":null},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:15.298530Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:31b3cbfede2ee3cf9e67f5663c4eba1896abe8d5abe6a91f2ea77a8b09dda26f","observation_id":"0ec0a9da-6c2b-42c2-82e7-bd83727448e0","resolution":{"observed_at":"2026-08-07T11:55:16.830330Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:16.699236Z","title":"Let's verify each visual cue and its reasoning before finalizing the answer","venue":null,"work_id":"756dccda-1e00-4041-842e-079a2f1312bf","year":null},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:15.335118Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:99bf9355e4ac38dc71961a32654a4aea831d7cc983c341790e1ee1451cde4845","observation_id":"7efba94b-a213-4ed4-a25a-0e79e112b29f","resolution":{"observed_at":"2026-08-07T11:55:16.740232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:16.616591Z","title":null,"venue":null,"work_id":"1993dd63-859e-40a8-af24-3409f1ecdc83","year":null},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:15.400221Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:987d3220482f0d96b9923d6b6fc87d08fc045beca11384ba5030fc92ae11e54f","observation_id":"37267687-4afd-40a6-98bb-e09353490526","resolution":{"observed_at":"2026-08-07T11:55:16.651087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:16.527686Z","title":"- The angle 78° is an interior angle of the triangle, and angle 1 is 42°","venue":null,"work_id":"69116ff9-fd80-4ec7-8fb7-3e603659e7df","year":null},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:15.434526Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:3a4a70fe13d8dc876c26db46a59c90134fc7bdb16c6ff282f811b92362d3dcec","observation_id":"8c3afcc1-d706-4bba-8d3f-c0c4259cfd39","resolution":{"observed_at":"2026-08-07T11:55:16.564150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:16.380632Z","title":"However, upon reevaluating the problem, it appears there might be a misunderstanding in the interpretation of the angles","venue":null,"work_id":"e4a14f41-de87-4d26-b272-e9caebb65fd5","year":null},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:15.463161Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:c064e5b4d4149c27481b78a93d6a4e8189e91916fdc0e75a0cc957b17d6fee8b","observation_id":"1993d855-5ca4-4b5a-a7dc-9b2a6750ef4a","resolution":{"observed_at":"2026-08-07T11:55:16.470842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:16.199303Z","title":"- <vcues_2>Angle 1 is 42°</vcues_2>","venue":null,"work_id":"400ff315-763a-4ce4-90fb-d8fb3813dfd8","year":null},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:15.498636Z"},"links":{"citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:56b07e09004b784712d5bf192913064d2e6f15da91951c968c4671b8c6c97c12","observation_id":"27496727-abc3-4c17-824f-ace683444b01","resolution":{"observed_at":"2026-08-07T11:55:16.279875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 6 inbound Pith citation observations for arXiv:2506.01078."}