{"as_of":"2026-08-10T17:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1224eede0e458f2057fb9672afc0ebaf31f46ab453e89aba720c25ccb4b725f","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:47:01.785737Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T18:35:57.326931Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:56:13.710075Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"cited_work":{"arxiv_id":"2505.23558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23558","snapshot_observed_at":"2026-07-01T20:56:13.710075Z","title":"Qwen look again: Guiding vision-language reasoning mod- els to re-attention visual information","venue":null,"work_id":"cc9e5e98-c226-4e12-bf74-ff438225c4c0","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":249,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2505.23558","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:cadd194f0c6cf5629f1c501c6fd141f30519e6da2fe421b17137223753f3af42","observation_id":"f2029779-be6f-4f46-9899-fc776e715073","resolution":{"observed_at":"2026-05-18T19:21:48.200111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"cited_work":{"arxiv_id":"2505.23558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23558","snapshot_observed_at":"2026-07-01T20:56:13.710075Z","title":"Qwen look again: Guiding vision-language reasoning mod- els to re-attention visual information","venue":null,"work_id":"cc9e5e98-c226-4e12-bf74-ff438225c4c0","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2505.23558","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:20ff5eda9ca2795d4426383212df722928e7ee02d42402de82429789e4c5ed23","observation_id":"abc59b88-cb27-4942-91d2-6eec3e75b2fd","resolution":{"observed_at":"2026-05-18T00:02:25.189746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23558","snapshot_observed_at":"2026-08-04T08:15:49.406668Z","title":"Qwen look again: Guiding vision-language reasoning models to re-attention visual information","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.21978","last_updated":"2026-06-18T16:29:38Z","snapshot_observed_at":"2026-08-09T00:06:37.608642Z","submitted_at":"2025-10-24T19:08:48Z","title":"Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T08:15:49.406668Z"},"links":{"cited_paper":"/paper/2505.23558","citing_paper":"/paper/2510.21978"},"observation_digest":"sha256:e5df837d1029fc41d7fdb9dd48dd1afa14b765d78a8258e1ac5610ea99932eb6","observation_id":"06c7f784-ff5a-481c-af43-884de631629c","resolution":{"observed_at":"2026-08-04T08:15:49.406668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"cited_work":{"arxiv_id":"2505.23558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23558","snapshot_observed_at":"2026-07-01T20:56:13.710075Z","title":"Qwen look again: Guiding vision-language reasoning mod- els to re-attention visual information","venue":null,"work_id":"cc9e5e98-c226-4e12-bf74-ff438225c4c0","year":2025},"citing_paper":{"arxiv_id":"2605.02035","last_updated":"2026-05-26T13:27:57Z","snapshot_observed_at":"2026-08-01T16:17:19.756210Z","submitted_at":"2026-05-03T19:55:06Z","title":"VIDA: A dataset for Visually Dependent Ambiguity in Multimodal Machine Translation","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-08T19:34:02.860270Z"},"links":{"cited_paper":"/paper/2505.23558","citing_paper":"/paper/2605.02035"},"observation_digest":"sha256:ea94b5c7bffcf591c21bd05c367c53dfb92591d8f340254888fe43558d52f606","observation_id":"7bfc4a53-e113-4053-b49f-f3a8bfc9871b","resolution":{"observed_at":"2026-05-09T05:50:25.875190Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"cited_work":{"arxiv_id":"2505.23558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23558","snapshot_observed_at":"2026-07-01T20:56:13.710075Z","title":"Qwen look again: Guiding vision-language reasoning mod- els to re-attention visual information","venue":null,"work_id":"cc9e5e98-c226-4e12-bf74-ff438225c4c0","year":2025},"citing_paper":{"arxiv_id":"2605.09614","last_updated":"2026-05-10T15:53:11Z","snapshot_observed_at":"2026-07-31T22:46:33.839024Z","submitted_at":"2026-05-10T15:53:11Z","title":"Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T02:24:12.349405Z"},"links":{"cited_paper":"/paper/2505.23558","citing_paper":"/paper/2605.09614"},"observation_digest":"sha256:3583a49568ac0311b01369f3f40e9aeb3005f305db72117d3debfca9fc036ae2","observation_id":"f082c79b-181f-43b6-9177-cebbd494ba4d","resolution":{"observed_at":"2026-05-12T07:41:25.456588Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"cited_work":{"arxiv_id":"2505.23558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23558","snapshot_observed_at":"2026-07-01T20:56:13.710075Z","title":"Qwen look again: Guiding vision-language reasoning mod- els to re-attention visual information","venue":null,"work_id":"cc9e5e98-c226-4e12-bf74-ff438225c4c0","year":2025},"citing_paper":{"arxiv_id":"2605.11974","last_updated":"2026-05-12T11:31:18Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:31:18Z","title":"Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-13T07:32:58.404947Z"},"links":{"cited_paper":"/paper/2505.23558","citing_paper":"/paper/2605.11974"},"observation_digest":"sha256:ecd857707defda338ba49b1df9f3ee6a8330a3409b194b598c141231ed938eab","observation_id":"2b9c0382-4228-465e-8d9e-8b8b7bad606c","resolution":{"observed_at":"2026-05-13T07:37:29.848712Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"cited_work":{"arxiv_id":"2505.23558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23558","snapshot_observed_at":"2026-07-01T20:56:13.710075Z","title":"Qwen look again: Guiding vision-language reasoning mod- els to re-attention visual information","venue":null,"work_id":"cc9e5e98-c226-4e12-bf74-ff438225c4c0","year":2025},"citing_paper":{"arxiv_id":"2605.13467","last_updated":"2026-05-13T12:55:18Z","snapshot_observed_at":"2026-08-03T01:46:31.336725Z","submitted_at":"2026-05-13T12:55:18Z","title":"PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T19:20:32.435135Z"},"links":{"cited_paper":"/paper/2505.23558","citing_paper":"/paper/2605.13467"},"observation_digest":"sha256:e830893aaf33d9a77f96721787e3d8db3d11a6c990ff6736b1cd0faa37c379de","observation_id":"802207f2-0def-40a0-a74c-838777043278","resolution":{"observed_at":"2026-05-14T19:22:50.397172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"cited_work":{"arxiv_id":"2505.23558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23558","snapshot_observed_at":"2026-07-01T20:56:13.710075Z","title":"Qwen look again: Guiding vision-language reasoning mod- els to re-attention visual information","venue":null,"work_id":"cc9e5e98-c226-4e12-bf74-ff438225c4c0","year":2025},"citing_paper":{"arxiv_id":"2605.18160","last_updated":"2026-06-02T05:15:38Z","snapshot_observed_at":"2026-07-06T23:29:04.241654Z","submitted_at":"2026-05-18T10:04:22Z","title":"Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T11:38:01.947806Z"},"links":{"cited_paper":"/paper/2505.23558","citing_paper":"/paper/2605.18160"},"observation_digest":"sha256:5b7776a06978a9122f3b3b44c579a7c08501bfd92b32384722ad372c3a80d6ed","observation_id":"4b0eca96-75f6-4ed6-97a1-39d6de2693a8","resolution":{"observed_at":"2026-05-20T11:38:14.456765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"cited_work":{"arxiv_id":"2505.23558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23558","snapshot_observed_at":"2026-07-01T20:56:13.710075Z","title":"Qwen look again: Guiding vision-language reasoning mod- els to re-attention visual information","venue":null,"work_id":"cc9e5e98-c226-4e12-bf74-ff438225c4c0","year":2025},"citing_paper":{"arxiv_id":"2605.18160","last_updated":"2026-06-02T05:15:38Z","snapshot_observed_at":"2026-07-06T23:29:04.241654Z","submitted_at":"2026-05-18T10:04:22Z","title":"Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T18:42:46.422756Z"},"links":{"cited_paper":"/paper/2505.23558","citing_paper":"/paper/2605.18160"},"observation_digest":"sha256:f55a77fafb07d33d32cf3c5ee6459594957b03542edb708968a4170264be0eb0","observation_id":"a657bc6d-0f89-468e-ad1a-a62fc1c75155","resolution":{"observed_at":"2026-06-30T18:45:00.148348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"cited_work":{"arxiv_id":"2505.23558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23558","snapshot_observed_at":"2026-07-01T20:56:13.710075Z","title":"Qwen look again: Guiding vision-language reasoning mod- els to re-attention visual information","venue":null,"work_id":"cc9e5e98-c226-4e12-bf74-ff438225c4c0","year":2025},"citing_paper":{"arxiv_id":"2606.00562","last_updated":"2026-05-30T06:33:24Z","snapshot_observed_at":"2026-08-02T17:36:55.980170Z","submitted_at":"2026-05-30T06:33:24Z","title":"DeepLatent: Think with Images via Parallel Latent Visual Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T18:44:39.545911Z"},"links":{"cited_paper":"/paper/2505.23558","citing_paper":"/paper/2606.00562"},"observation_digest":"sha256:ef44a082038db2bdfa22a24dc054a9e6ecaf44bed9db73c15f22eeb77404e38f","observation_id":"3bc2bbb6-ff74-4f4e-904b-77d8cf1c76ab","resolution":{"observed_at":"2026-06-28T20:22:37.749897Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"cited_work":{"arxiv_id":"2505.23558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23558","snapshot_observed_at":"2026-07-01T20:56:13.710075Z","title":"Qwen look again: Guiding vision-language reasoning mod- els to re-attention visual information","venue":null,"work_id":"cc9e5e98-c226-4e12-bf74-ff438225c4c0","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.23558","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:559203abfe0113630d1f40db318cf4f22612997ac06ad1c7ed0f33f1c297a4f5","observation_id":"82634a68-c29c-4b80-af0a-e17b2ce07de2","resolution":{"observed_at":"2026-07-01T20:56:13.711776Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23558","snapshot_observed_at":"2026-08-04T18:10:03.746032Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01930","last_updated":"2026-08-03T09:02:45Z","snapshot_observed_at":"2026-08-09T03:01:02.607987Z","submitted_at":"2026-08-03T09:02:45Z","title":"Recompute or Reuse? Diagnosing and Mitigating Textual Shortcuts in VLM Self-Reflection","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T18:10:03.746032Z"},"links":{"cited_paper":"/paper/2505.23558","citing_paper":"/paper/2608.01930"},"observation_digest":"sha256:12e2fcf5a92e1479e6bb28786d2d6e30f4c15e5b15debf2e113a49ab7bd695f5","observation_id":"5bc3f27d-8948-4577-8e54-56eb41bc179f","resolution":{"observed_at":"2026-08-04T18:10:03.746032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23558","snapshot_observed_at":"2026-08-08T18:35:57.326931Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04385","last_updated":"2026-08-05T02:41:53Z","snapshot_observed_at":"2026-08-09T11:44:48.762738Z","submitted_at":"2026-08-05T02:41:53Z","title":"ReGround: Restoring Visual Grounding in Multi-Step Reasoning through Self-Diagnosis and Visual Re-Examination","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T18:35:57.326931Z"},"links":{"cited_paper":"/paper/2505.23558","citing_paper":"/paper/2608.04385"},"observation_digest":"sha256:bd63c9d27528de1786b7cea905df142eba0e5e30b55138e13623bbf602afb1cd","observation_id":"03ffff5b-05c1-40d8-8dda-06e9bffd6418","resolution":{"observed_at":"2026-08-08T18:35:57.326931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23558","snapshot_observed_at":"2026-08-08T05:37:05.262886Z","title":"arXiv preprint arXiv:2505.23558 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05611","last_updated":"2026-08-06T05:13:59Z","snapshot_observed_at":"2026-08-10T03:02:55.851766Z","submitted_at":"2026-08-06T05:13:59Z","title":"FOCUS: Decoupling Expert Personas in LLMs to Enhance Domain Expert Capabilities","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T05:37:05.262886Z"},"links":{"cited_paper":"/paper/2505.23558","citing_paper":"/paper/2608.05611"},"observation_digest":"sha256:03c08e3db717be61954714fddc33febf44bce75f3cf729b253194db4177ed7a2","observation_id":"814def5c-f9f9-4f37-b6d8-ae11523efc6c","resolution":{"observed_at":"2026-08-08T05:37:05.262886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23558/citation-record","integrity":"/paper/2505.23558/integrity","json":"/paper/2505.23558/citation-record.json","paper":"/paper/2505.23558"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-07T12:46:56.797233Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:56.797233Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:ae02537c29fc3c61389e2f0f94db06e1df8060c6d193aa23196ce77d09b3d632","observation_id":"60f2861c-ab4c-4645-bc90-50a223680fb1","resolution":{"observed_at":"2026-08-07T12:46:56.797233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:46:56.866271Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:56.866271Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:c6713b5e5bb9a0c8687f569526c52d3ae662c9c1bbd98b4fd38a2d421edc2bf1","observation_id":"6fcef8b2-045e-4190-9575-d16262bf1bc3","resolution":{"observed_at":"2026-08-07T12:46:56.866271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-08-07T12:46:56.966984Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:56.966984Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:f5a18d9cda1eb01cbf36e8f0004f69ff513b07682bcfcfdfc87f4e12adc506b2","observation_id":"a4d0c8dd-2a5e-4fbf-ab85-a3e4745f2f97","resolution":{"observed_at":"2026-08-07T12:46:56.966984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T12:46:57.052968Z","title":"Are we on the right way for evaluating large vision-language models? ArXiv, abs/2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:57.052968Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:4fd5bfbeb4fa40eec653cda48d7877f2393067540c773665ebca154b5c86ac30","observation_id":"3bc66e3e-f9b7-42f2-92bd-0c0baef14c5f","resolution":{"observed_at":"2026-08-07T12:46:57.052968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-07T12:46:57.134608Z","title":"Towards reasoning era: A survey of long chain-of-thought for reasoning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:57.134608Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:43a3f9375b8be60d21c19867b554ee8bc6a76c67c4229e65a64a3ad202ac12f4","observation_id":"1673187c-8713-4f58-bd18-612a207dcaf0","resolution":{"observed_at":"2026-08-07T12:46:57.134608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:57.256539Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:57.256539Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:e78d8a87d78b834714d0c7bab8e8829fcf1a0ee7a8046598aa5063d7216b7305","observation_id":"919b809c-8c4f-4fe3-956a-f558d02f8ecf","resolution":{"observed_at":"2026-08-07T12:46:57.256539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14431","last_updated":"2025-05-28T06:18:34Z","snapshot_observed_at":"2026-08-10T15:07:23.516203Z","submitted_at":"2025-01-24T11:57:39Z","title":"Domaino1s: Guiding LLM Reasoning for Explainable Answers in High-Stakes Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14431","snapshot_observed_at":"2026-08-07T12:46:57.366795Z","title":"Domaino1s: Guiding llm reasoning for explainable answers in high-stakes domains.arXiv preprint arXiv:2501.14431, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:57.366795Z"},"links":{"cited_paper":"/paper/2501.14431","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:72ee13e382c940dc7417149ea46ee69cae24b0c4b224dec62f6dc3d5abc32de4","observation_id":"eaee9fe0-d871-4513-a911-4c97683c6145","resolution":{"observed_at":"2026-08-07T12:46:57.366795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:06.277468Z","title":"Multi-modal hallucination control by visual information grounding","venue":null,"work_id":"41486305-264d-42ff-9472-033116871d7b","year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:57.455271Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:dd2ad3885a8cfbdc3702a579dfe50d5dab09024f4d2db8276fe318b238ad8e10","observation_id":"2a513fc2-8e07-4d06-960f-ea9839f087af","resolution":{"observed_at":"2026-08-07T12:47:06.401434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T12:46:57.532832Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:57.532832Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:ee4e315b4817fd17115331aea79cfa90cd68ba8e07bc96148d83f3df8b16f310","observation_id":"fd15205e-b644-4b87-925c-6436a4cf584c","resolution":{"observed_at":"2026-08-07T12:46:57.532832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:06.015932Z","title":"Interleaved-modal chain-of-thought","venue":null,"work_id":"d300301c-1984-4692-a3b5-e408e733465b","year":2025},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:57.635144Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:b927adc8778723be018492ad9defdb273a8148aacb96c81017164dec08ae88a1","observation_id":"352f77d5-3375-454d-9d7d-b45883502b41","resolution":{"observed_at":"2026-08-07T12:47:06.156892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T12:46:57.742899Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:57.742899Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:21dc777c87b1fdaf725431fef5c8d15d46e51fa8957433afdd31690e4742732a","observation_id":"20f902ef-7921-45f8-b284-8687f67e0516","resolution":{"observed_at":"2026-08-07T12:46:57.742899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14702","last_updated":"2026-05-10T19:30:43Z","snapshot_observed_at":"2026-07-06T19:36:10.759412Z","submitted_at":"2024-10-06T20:35:41Z","title":"Polymath: A Challenging Multi-modal Mathematical Reasoning Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14702","snapshot_observed_at":"2026-08-07T12:46:57.837468Z","title":"Polymath: A challenging multi-modal mathematical reasoning benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:57.837468Z"},"links":{"cited_paper":"/paper/2410.14702","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:7af7729f085626276d9da2458810748151827a70e2b1269ffe0bbc9daf5cf5a4","observation_id":"e68b1931-f95f-453c-b956-09a05213bcd1","resolution":{"observed_at":"2026-08-07T12:46:57.837468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:05.761287Z","title":"Opera: Alleviating hallucination in multi-modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":"bb7bbf2c-5e01-4e9e-9646-069bb6d27961","year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:57.922825Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:ef54a323e54d46f530f983ea05f20938c9669d6fed6d967c5d5df07d7a12106d","observation_id":"6d5df679-2071-4885-a2e0-647e16a7b1c4","resolution":{"observed_at":"2026-08-07T12:47:05.878947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T12:46:57.993708Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:57.993708Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:8d68f993b6bd6a812658ad9f0bb90a1da334321736dca908b14eb91632c0aff5","observation_id":"033b129e-89f6-41dd-848c-a5e69abb4537","resolution":{"observed_at":"2026-08-07T12:46:57.993708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T12:46:58.082130Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:58.082130Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:e824acb65bbdb4f6d2ff11611ddd9efd2b70e8950d1c0ff6c31c2738d9ee1d3e","observation_id":"741f2efc-eef0-49d3-8ff2-1ee6e5acdc7c","resolution":{"observed_at":"2026-08-07T12:46:58.082130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:05.502395Z","title":"Biomistral: A collection of open-source pretrained large language models for medical domains","venue":null,"work_id":"f4ed5f29-302d-45f2-a0b0-70dff213764e","year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:58.155944Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:47e7350ae1bcecc8a25fc4a034096bcf57511c45494e14e5be0fd501ce43b62b","observation_id":"f55dcc76-586f-4dfe-9f97-b2bc8b2fdf61","resolution":{"observed_at":"2026-08-07T12:47:05.636211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:05.278491Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"a4e5910d-135d-4f56-979c-91bd269a3b94","year":2023},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:58.285557Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:3f2cb2246fec60ebc11edd7870d356066ec3f77029916260fa7bc2f2c18952a3","observation_id":"b5158816-4f1d-4986-b535-6059ce02f7fb","resolution":{"observed_at":"2026-08-07T12:47:05.379247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03628","last_updated":"2025-07-01T16:02:21Z","snapshot_observed_at":"2026-08-09T11:44:14.633025Z","submitted_at":"2025-02-05T21:34:02Z","title":"The Hidden Life of Tokens: Reducing Hallucination of Large Vision-Language Models via Visual Information Steering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03628","snapshot_observed_at":"2026-08-07T12:46:58.368000Z","title":"The hidden life of tokens: Reducing hallucination of large vision-language models via visual information steering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:58.368000Z"},"links":{"cited_paper":"/paper/2502.03628","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:96fdaf0849c6ad01f0b9711e2412bdbf43c7d23f1f9fb8a07342c3c3a77ba208","observation_id":"a6b90a7f-732c-47cb-b351-cabaff831831","resolution":{"observed_at":"2026-08-07T12:46:58.368000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05138","last_updated":"2024-02-06T19:16:55Z","snapshot_observed_at":"2026-07-06T17:27:03.686119Z","submitted_at":"2024-02-06T19:16:55Z","title":"SceMQA: A Scientific College Entrance Level Multimodal Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05138","snapshot_observed_at":"2026-08-07T12:46:58.466261Z","title":"Scemqa: A scientific college entrance level multimodal question answering benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:58.466261Z"},"links":{"cited_paper":"/paper/2402.05138","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:e9cad3fb982b5d15d6910b9295ceeb2d36913d3bd7f8e2ca4108643a70d7176c","observation_id":"be3c8ace-1240-4e8f-96df-d91da30c9868","resolution":{"observed_at":"2026-08-07T12:46:58.466261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15362","last_updated":"2025-04-21T18:10:38Z","snapshot_observed_at":"2026-08-07T16:00:28.824750Z","submitted_at":"2025-04-21T18:10:38Z","title":"LongPerceptualThoughts: Distilling System-2 Reasoning for System-1 Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15362","snapshot_observed_at":"2026-08-07T12:46:58.552403Z","title":"Longperceptualthoughts: Distilling system-2 reasoning for system-1 perception","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:58.552403Z"},"links":{"cited_paper":"/paper/2504.15362","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:e2f4e66e8f51446c2f0162ea8ed287ee08703c7ab589b7c6aa93188840d009d1","observation_id":"123bfd87-ab2b-4802-8549-14d80ab4d50e","resolution":{"observed_at":"2026-08-07T12:46:58.552403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:58.663416Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:58.663416Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:90e3985595ec4c6eae5711bd6d1fcb5a04e96245bce9c1d088c0fa85ab8e99f9","observation_id":"5d2a8a9f-486d-4d1f-9cc6-99fa2dd92d98","resolution":{"observed_at":"2026-08-07T12:46:58.663416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-07-06T17:23:26.913214Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-07T12:46:58.777852Z","title":"A survey on hallucination in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:58.777852Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:2c8b371052cfa279568ac704ef5b987555e85c89a3da991c538dda8c36fd83de","observation_id":"763e2e7c-a068-4cbe-aa2f-ab0415f2af7c","resolution":{"observed_at":"2026-08-07T12:46:58.777852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:05.023385Z","title":"Paying more attention to image: A training-free method for alleviating hallucination in lvlms","venue":null,"work_id":"32d911c3-683c-464d-8eca-48b4457e20a4","year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:58.860271Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:adb7bf9be65ef1530e5f60947fa81b019e0efb07fe07bdebe0e11a8b67fd492e","observation_id":"45410499-e16f-4cab-9deb-be28ce4a0e86","resolution":{"observed_at":"2026-08-07T12:47:05.158822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:04.791715Z","title":"Mmbench: Is your multi-modal model an all-around player? In European Conference on Computer Vision, 2023","venue":null,"work_id":"14d03fbb-6d28-48c0-9e5f-f09a9edeb604","year":2023},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:58.973923Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:65f6c6e7a63b742425d5abaaf2a9aa4932a1344b7781d5cc89ca73de29b4a851","observation_id":"51a56be6-df60-46ad-9151-b97942bd1319","resolution":{"observed_at":"2026-08-07T12:47:04.905487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T12:46:59.067336Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:59.067336Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:4f52b98ca3ea36edbd8e274ab46036d041f4a810a83e9f58a81ba046c4d0e76b","observation_id":"558c957c-870a-4438-88c3-8e79bc8119a1","resolution":{"observed_at":"2026-08-07T12:46:59.067336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:04.596468Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":"cfc5378a-eb69-4f51-b0f8-09886588b307","year":2021},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:59.116849Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:5c87950d12bb790477636f5d5f424ee425bc47c4945ed20246ec5a9a12f6777e","observation_id":"cd78694e-34c7-4efb-bfb5-dac2d468a5de","resolution":{"observed_at":"2026-08-07T12:47:04.662827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:59.178668Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:59.178668Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:6f4b001e5ce5d41da91364e3ba54e3ba04624425da3559ef5ade04029f9c98b2","observation_id":"6358699e-f146-4869-8c2f-51d4bc6c52f8","resolution":{"observed_at":"2026-08-07T12:46:59.178668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:04.391689Z","title":"Llama 3.2: Revolutionizing edge ai and vision with open, customizable models","venue":null,"work_id":"d59d5d52-f7fa-4a06-ba37-7316e5ef1800","year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:59.265650Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:dcc2d8fb66af7a46171bd308d7fc72d7c1d9f4038214eebc8eb3b247cae6824b","observation_id":"b5e35968-f5ed-4daa-adde-f75dff7d9c8d","resolution":{"observed_at":"2026-08-07T12:47:04.514744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:04.220493Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"fab1845f-540a-427d-b38d-0b9970ab0179","year":2022},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:59.353347Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:8fa39cd0723952de83b382e2eb2cad28f71aa9beb0033ef6cc3359595c403090","observation_id":"a7418947-df2c-4e2b-a983-b4eeec6425af","resolution":{"observed_at":"2026-08-07T12:47:04.301808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-07T12:46:59.437972Z","title":"We-math: Does your large multimodal model achieve human-like mathematical reasoning? arXiv preprint arXiv:2407.01284, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:59.437972Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:7b8f29010b47d3db9fca98b62bf3db158aa814effd81e1d5c7d514f510f8a451","observation_id":"ae12a27c-aacd-4056-9629-3b1e1ff09aa6","resolution":{"observed_at":"2026-08-07T12:46:59.437972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:03.987531Z","title":"Object hallucination in image captioning","venue":null,"work_id":"c2f9e192-3e68-4012-beb5-97bb5bb00ccc","year":2018},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:59.512863Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:f8f0ed87b3f9f51653c26cc6ef6d1d6e901b1130de5cbd72186b951112000c1f","observation_id":"92a6b55c-ab2b-4c49-9a12-cdc211b13e87","resolution":{"observed_at":"2026-08-07T12:47:04.112885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:46:59.619339Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:59.619339Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:f3634f80479167b4904af5e681f151b6010b58e61c1545d627835af180176c63","observation_id":"0725dd7e-172c-4309-87d9-727c3714796b","resolution":{"observed_at":"2026-08-07T12:46:59.619339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-07T12:46:59.707360Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:59.707360Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:d7d0e7945ea746c2b5cec551be38af197f685dab22c6e652273a053745609760","observation_id":"70cfd12d-6bb8-4076-b6aa-c696ae98a268","resolution":{"observed_at":"2026-08-07T12:46:59.707360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-07T12:46:59.778241Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:59.778241Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:9ecd1c4be06bca0e25d3b3ffc458b2c8bcfcc9864749affdc26badae6ebdf9ea","observation_id":"eb4c7f28-f036-42de-bae9-f07e8590b54e","resolution":{"observed_at":"2026-08-07T12:46:59.778241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:03.809193Z","title":null,"venue":null,"work_id":"87f4ced2-178b-46a3-971b-3582d6c5afc4","year":2025},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:59.845272Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:68c89364c4940bababf84dad8a9ffa768181eec99b4e8ccfc144fd01e811460a","observation_id":"829e5e99-5495-429a-ba3e-38a27a30850a","resolution":{"observed_at":"2026-08-07T12:47:03.891279Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-09T09:48:45.884814Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-07T12:46:59.887522Z","title":"Kimi-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:59.887522Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:55ca33f257b946f199d1026ef2df8147016aac86d253f09e209cbe99c9d1c45d","observation_id":"583ae5aa-a7bf-4e70-918a-c47143a2f432","resolution":{"observed_at":"2026-08-07T12:46:59.887522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:00.015786Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:00.015786Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:8b70608f1815d14e6e275d3049b1636e6d73bbc8ba88e0b61f685a56a91fef77","observation_id":"c511529b-98b2-4b79-a228-5d26dff8fecf","resolution":{"observed_at":"2026-08-07T12:47:00.015786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:03.647418Z","title":"Is a picture worth a thousand words? delving into spatial reasoning for vision language models","venue":null,"work_id":"6c92ed60-08bc-4787-ad7e-ce2b7b12afc4","year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:00.151402Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:c6efa890b5cf26768a5dc655690ff91c56246a84c4a98dfc278d448760cf04d9","observation_id":"ffaf6595-cd68-45fc-8ce8-5698ee2aa02a","resolution":{"observed_at":"2026-08-07T12:47:03.727145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:03.459700Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":"31f65174-1555-437c-af74-2ecd8e87c2c6","year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:00.265319Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:26d0bbac3f965271ed7eb84e1a3fd2f0625e2d3709e774737837b90222f3e997","observation_id":"b4f6cf26-2359-498a-9f6a-86ef2d58c6c1","resolution":{"observed_at":"2026-08-07T12:47:03.561682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:03.282372Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":"23784ecf-ea98-4c08-991a-bfe93bd537d6","year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:00.365280Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:d0172bb49ecdc6ba71e52ad7782748dbecdffb20b00aa2ae4e40e5c331391fd2","observation_id":"d746bc4b-215f-45be-bd21-171ad9a37e00","resolution":{"observed_at":"2026-08-07T12:47:03.345447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-07T12:47:00.502361Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:00.502361Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:176823740e938ad527fe40306bccb3675aeab0d5eee895c30321bf39b0452a56","observation_id":"a418903f-ed73-4b48-b6e9-4361ec7457ec","resolution":{"observed_at":"2026-08-07T12:47:00.502361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-07T12:47:00.612735Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:00.612735Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:1bbe269c426126e397fcdda9c9340b99bd4b98cfe495c1743ba3e36458e72c4e","observation_id":"67f8666e-ca3d-4af8-a749-fc20a58d4965","resolution":{"observed_at":"2026-08-07T12:47:00.612735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24370","last_updated":"2025-05-21T17:51:27Z","snapshot_observed_at":"2026-08-07T16:20:08.878901Z","submitted_at":"2025-03-31T17:50:13Z","title":"Effectively Controlling Reasoning Models through Thinking Intervention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24370","snapshot_observed_at":"2026-08-07T12:47:00.722358Z","title":"Effectively controlling reasoning models through thinking intervention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:00.722358Z"},"links":{"cited_paper":"/paper/2503.24370","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:ea22bfea18343c7c5d27180fc480bd7839567cf9831fe21d7822f1de0887ca20","observation_id":"ba9b954b-098b-449f-86d4-2609cd100792","resolution":{"observed_at":"2026-08-07T12:47:00.722358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:00.802097Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:00.802097Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:4ec017e0257493990cc98eeea8643139218c9269150c610fffa189dc8cd90d02","observation_id":"6545da88-f4b4-4137-8dcf-8ef097ed4269","resolution":{"observed_at":"2026-08-07T12:47:00.802097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:03.096028Z","title":"Monte carlo tree search boosts reasoning via iterative preference learning","venue":null,"work_id":"0219dc3b-84a9-4631-b593-035c499f602a","year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:00.910999Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:1a48ff2c6779c49b2d1084cacd196bf4cf9b73485cf4110a8a02640153d8ef1f","observation_id":"97cfb2fa-c047-4b8a-b8a0-dad610865a94","resolution":{"observed_at":"2026-08-07T12:47:03.190820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T12:47:01.012397Z","title":"Llava-cot: Let vision language models reason step-by-step, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:01.012397Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:caad08abc2a2a59cc33ebf13af077e09edb0e17ded43c76d1da3abbad163a858","observation_id":"7260feb5-fffd-4693-b521-b44416107a60","resolution":{"observed_at":"2026-08-07T12:47:01.012397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T12:47:01.136361Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:01.136361Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:e72823cfceba69854d3e30136667e95940d22ad16c2ef20a6933fe932dd9a541","observation_id":"1eeb526c-3259-4c60-8d94-077fd5debf1a","resolution":{"observed_at":"2026-08-07T12:47:01.136361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17425","last_updated":"2025-02-24T18:56:12Z","snapshot_observed_at":"2026-08-07T17:52:18.653123Z","submitted_at":"2025-02-24T18:56:12Z","title":"Introducing Visual Perception Token into Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17425","snapshot_observed_at":"2026-08-07T12:47:01.250685Z","title":"Introducing visual perception token into multi- modal large language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:01.250685Z"},"links":{"cited_paper":"/paper/2502.17425","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:19e5fe9259f9c404346462dac07d3844d3e0d81e420e612936a28836703a9fdb","observation_id":"15fad10e-f36d-4452-91f7-f6b04cb1e2f2","resolution":{"observed_at":"2026-08-07T12:47:01.250685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:02.889696Z","title":"Advancing llm reasoning generalists with preference trees","venue":null,"work_id":"a0f346ce-5311-4eca-9a42-0bc615b40b9e","year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:01.338568Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:c5993fc50957fd08dd5dfa8b70da45bca50eae5b521c372faedebcaf9505e2bf","observation_id":"7dd40c86-4953-4b08-9e51-f7ac614f600a","resolution":{"observed_at":"2026-08-07T12:47:02.981358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:01.439459Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:01.439459Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:889ed4bd2ea524d385c2d5ea4d5bc34942007d078ee570a8a2b15d20b9064e99","observation_id":"2168333b-3154-4a8b-85c0-796d7a797f7d","resolution":{"observed_at":"2026-08-07T12:47:01.439459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-07T12:47:01.516742Z","title":"Mmmu-pro: A more robust multi-discipline multimodal understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:01.516742Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:c0510d69232198f52f927a9bf30a8b0fd75aca4e7b521d82eee2226c14b325ed","observation_id":"c732349c-ed7c-48c5-951d-accacbfb2eda","resolution":{"observed_at":"2026-08-07T12:47:01.516742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:02.668748Z","title":"Self-contrast: Better reflection through inconsistent solving perspectives","venue":null,"work_id":"be7907b3-b04b-44f4-aae9-69736e5f0b0b","year":2024},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:01.631849Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:615ed35ab02aacf2963dea671996a86d3fed9fcf424539e2b819f8279c097889","observation_id":"5aba6c03-03ed-4c42-b360-c96b929b6138","resolution":{"observed_at":"2026-08-07T12:47:02.773457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00754","last_updated":"2024-03-16T19:28:08Z","snapshot_observed_at":"2026-08-02T06:11:56.496482Z","submitted_at":"2023-10-01T18:10:53Z","title":"Analyzing and Mitigating Object Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00754","snapshot_observed_at":"2026-08-07T12:47:01.720803Z","title":"Analyzing and mitigating object hallucination in large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:01.720803Z"},"links":{"cited_paper":"/paper/2310.00754","citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:fc786dee43a5989d6bfc19fa9cf53b2678f025d2b5da2dd912f7e23a438de2d4","observation_id":"20243db5-940e-4204-80eb-b655940ea41f","resolution":{"observed_at":"2026-08-07T12:47:01.720803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:47:02.416831Z","title":"correct\" or","venue":null,"work_id":"4ff8d148-19af-43d4-aac5-f9a2b790ee44","year":null},"citing_paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:01.785737Z"},"links":{"citing_paper":"/paper/2505.23558"},"observation_digest":"sha256:ec02e0c76ea0ff2283838aacfabbccb57132b1bccd755108d5e1f5efaadc44a5","observation_id":"f7c07630-ab3d-4dc9-8703-8c114c61759b","resolution":{"observed_at":"2026-08-07T12:47:02.583769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23558","last_updated":"2025-05-30T07:37:34Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T09:31:06.302777Z","submitted_at":"2025-05-29T15:34:15Z","title":"Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 14 inbound Pith citation observations for arXiv:2505.23558."}