{"as_of":"2026-08-10T07:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:59d498b4f0f23126dad5305e938a565eca3abbece390950d003831bf2e9cc10d","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:45:30.735139Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:31:41.386191Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T13:43:28.625652Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"cited_work":{"arxiv_id":"2506.07235","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07235","snapshot_observed_at":"2026-06-29T13:43:28.625652Z","title":"Multi-step visual reasoning with visual tokens scaling and verification","venue":null,"work_id":"19cacd40-1252-4b37-8c9b-b7006ca05a21","year":2025},"citing_paper":{"arxiv_id":"2512.09299","last_updated":"2026-04-06T13:16:33Z","snapshot_observed_at":"2026-07-06T22:38:35.387503Z","submitted_at":"2025-12-10T03:57:29Z","title":"VABench: A Comprehensive Benchmark for Audio-Video Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T00:03:45.576961Z"},"links":{"cited_paper":"/paper/2506.07235","citing_paper":"/paper/2512.09299"},"observation_digest":"sha256:0e9edc030605cd87aee9bb8647296b6d6ceb6f276f13cd83fe99965312c1f9fa","observation_id":"39b49e20-785e-4b2e-9bf3-6d436a00e7db","resolution":{"observed_at":"2026-05-17T00:08:43.833402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"cited_work":{"arxiv_id":"2506.07235","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07235","snapshot_observed_at":"2026-06-29T13:43:28.625652Z","title":"Multi-step visual reasoning with visual tokens scaling and verification","venue":null,"work_id":"19cacd40-1252-4b37-8c9b-b7006ca05a21","year":2025},"citing_paper":{"arxiv_id":"2604.04707","last_updated":"2026-05-25T06:28:44Z","snapshot_observed_at":"2026-07-13T09:42:22.607962Z","submitted_at":"2026-04-06T14:19:48Z","title":"OpenWorldLib: A Unified Codebase and Definition of Advanced World Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T19:36:42.100191Z"},"links":{"cited_paper":"/paper/2506.07235","citing_paper":"/paper/2604.04707"},"observation_digest":"sha256:90699291fdd9cdee2ba74e012a1408ad5a23fcb61692f2d3c25d26efd0d3f10c","observation_id":"12e287ce-b650-4ece-9a3a-d938f677967b","resolution":{"observed_at":"2026-05-10T22:45:49.164337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07235","snapshot_observed_at":"2026-07-13T09:42:23.808691Z","title":"Multi-step visual reasoning with visual tokens scaling and verification.arXiv preprint arXiv:2506.07235, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.04707","last_updated":"2026-05-25T06:28:44Z","snapshot_observed_at":"2026-07-13T09:42:22.607962Z","submitted_at":"2026-04-06T14:19:48Z","title":"OpenWorldLib: A Unified Codebase and Definition of Advanced World Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T09:42:23.808691Z"},"links":{"cited_paper":"/paper/2506.07235","citing_paper":"/paper/2604.04707"},"observation_digest":"sha256:d72d251a70e6520a3c45d698053ba9525f23b8fe92525c430cad810bc41f1c12","observation_id":"979eb267-7af1-4b5b-94d9-ca1c7e9f0ca1","resolution":{"observed_at":"2026-07-13T09:42:23.808691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"cited_work":{"arxiv_id":"2506.07235","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07235","snapshot_observed_at":"2026-06-29T13:43:28.625652Z","title":"Multi-step visual reasoning with visual tokens scaling and verification","venue":null,"work_id":"19cacd40-1252-4b37-8c9b-b7006ca05a21","year":2025},"citing_paper":{"arxiv_id":"2604.11025","last_updated":"2026-08-02T20:03:04Z","snapshot_observed_at":"2026-08-06T23:24:25.912298Z","submitted_at":"2026-04-13T05:49:04Z","title":"Test-time Scaling over Perception: Resolving the Grounding Paradox in Thinking with Images","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:11.785469Z"},"links":{"cited_paper":"/paper/2506.07235","citing_paper":"/paper/2604.11025"},"observation_digest":"sha256:aeb37d7f1d762592c52af95d4bd3a2191431bb9d1ce8e7d760cd4511f868754e","observation_id":"d546229b-d332-4831-9195-e3e3a43148fb","resolution":{"observed_at":"2026-05-11T08:26:01.651378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07235","snapshot_observed_at":"2026-08-04T05:31:41.386191Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11025","last_updated":"2026-08-02T20:03:04Z","snapshot_observed_at":"2026-08-06T23:24:25.912298Z","submitted_at":"2026-04-13T05:49:04Z","title":"Test-time Scaling over Perception: Resolving the Grounding Paradox in Thinking with Images","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T05:31:41.386191Z"},"links":{"cited_paper":"/paper/2506.07235","citing_paper":"/paper/2604.11025"},"observation_digest":"sha256:a82433525b2781cdfe750e5cd1604e9c3169d76a16a0a851ee04218977ee4bc6","observation_id":"ab9dbc9c-ef0d-4135-bed8-94aa1b062247","resolution":{"observed_at":"2026-08-04T05:31:41.386191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"cited_work":{"arxiv_id":"2506.07235","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07235","snapshot_observed_at":"2026-06-29T13:43:28.625652Z","title":"Multi-step visual reasoning with visual tokens scaling and verification","venue":null,"work_id":"19cacd40-1252-4b37-8c9b-b7006ca05a21","year":2025},"citing_paper":{"arxiv_id":"2605.22177","last_updated":"2026-05-21T08:47:49Z","snapshot_observed_at":"2026-08-02T13:10:19.838403Z","submitted_at":"2026-05-21T08:47:49Z","title":"Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T07:51:13.362986Z"},"links":{"cited_paper":"/paper/2506.07235","citing_paper":"/paper/2605.22177"},"observation_digest":"sha256:97ee7cbdaab79a447d472c7b3655f19bbc9893b71d81c22c4125e01c71478d7a","observation_id":"fee230e5-cb3d-4ff1-923f-61f1c48c44b0","resolution":{"observed_at":"2026-05-22T07:51:15.425338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"cited_work":{"arxiv_id":"2506.07235","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07235","snapshot_observed_at":"2026-06-29T13:43:28.625652Z","title":"Multi-step visual reasoning with visual tokens scaling and verification","venue":null,"work_id":"19cacd40-1252-4b37-8c9b-b7006ca05a21","year":2025},"citing_paper":{"arxiv_id":"2605.27959","last_updated":"2026-05-28T03:13:45Z","snapshot_observed_at":"2026-07-06T23:37:36.244456Z","submitted_at":"2026-05-27T04:52:42Z","title":"ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T13:41:44.049230Z"},"links":{"cited_paper":"/paper/2506.07235","citing_paper":"/paper/2605.27959"},"observation_digest":"sha256:3149b8239959186f3f6c44924681c8fbf140dd4ac43e91285d42c6ef1090a3a2","observation_id":"37134517-1422-4099-86b4-023ea435cf36","resolution":{"observed_at":"2026-06-29T13:43:28.627224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07235","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2506.07235 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":164,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2506.07235","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:60a7faa39feb92a799ef4741aebe62165f4f71bcd15b6e4a7f0053e5208a0fd3","observation_id":"e1a2eaa2-1aba-4f20-8b48-d2dcdff3366a","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07235/citation-record","integrity":"/paper/2506.07235/integrity","json":"/paper/2506.07235/citation-record.json","paper":"/paper/2506.07235"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.197609Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":"cec44510-f12e-4609-bf04-fc70a8ca7a2c","year":2025},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.587797Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:5861bd8075266f8e558f71490190009b15840b19a5231f29f48eb02897ec1f05","observation_id":"26949dd0-946c-4b20-8aae-73a130af3245","resolution":{"observed_at":"2026-08-07T05:45:31.201843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.184660Z","title":"V∗: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":"e1e5bb65-d334-459c-86e9-5be3bf94689c","year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.591770Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:cc9b0f6e9f52606bbaa8f7b7466845d08ac8ddbae11a99c634b1cac95e7b7f85","observation_id":"252017fe-5670-4cb6-b23d-e17e2c40e8b6","resolution":{"observed_at":"2026-08-07T05:45:31.188988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:30.595949Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.595949Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:1e00a2b4af206c2ba015c0ec94a2b27be1f22714063ba76b93a76a0fbcb42094","observation_id":"e674edb9-6e54-4a7f-aa85-33d81f32411a","resolution":{"observed_at":"2026-08-07T05:45:30.595949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-07T05:45:30.600959Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.600959Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:25045f5eb16355c9f8719921b27a2b3cac0939b965c2ebf619394b412b65aca8","observation_id":"e5b51c26-c286-46df-9016-544557ae8b24","resolution":{"observed_at":"2026-08-07T05:45:30.600959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16999","last_updated":"2024-11-04T05:50:56Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:59:23Z","title":"Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16999","snapshot_observed_at":"2026-08-07T05:45:30.605338Z","title":"Visual cot: Unleashing chain-of-thought reasoning in multi-modal language models.arXiv preprint arXiv:2403.16999, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.605338Z"},"links":{"cited_paper":"/paper/2403.16999","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:03182c6cf866e47ba69b51d9bb0eeed4a36e6cb7e350da299e4ed646f3090570","observation_id":"bbb19b7a-cbac-4017-9c6e-430cd949d879","resolution":{"observed_at":"2026-08-07T05:45:30.605338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-07T05:45:30.610059Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic.arXiv preprint arXiv:2306.15195, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.610059Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:2b68fbce32445c9344bd777649c07b4167a6bb4f2ea0d65d0901156de8c2907d","observation_id":"52e12acf-5b2a-4255-8ca5-94afd5e420d3","resolution":{"observed_at":"2026-08-07T05:45:30.610059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.163933Z","title":"Visual program distillation: Distilling tools and programmatic reasoning into vision-language models","venue":null,"work_id":"275ec3cf-a1b6-4cc6-9e6a-d9b2df120f45","year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.615181Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:6f131eb2575bdca593ca4593ff54cd2523930eb7693fa182f2fb84e44f29f6fe","observation_id":"5d8a4253-37a2-4eec-abcf-5c91400e7576","resolution":{"observed_at":"2026-08-07T05:45:31.168232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:30.619311Z","title":"Visual programming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.619311Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:0761e04303cf41eba40a0772e18b4162cc1f2001393d1ba194124149a8ad710c","observation_id":"cbcf874c-d05b-42ec-a1f6-e7368d67ad0b","resolution":{"observed_at":"2026-08-07T05:45:30.619311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.141669Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":"c18d65f7-a84e-4dd6-ac4d-9cd8dff8a607","year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.623036Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:0c2f86ca4fb609087332024ffae973f410e55661d25e3e43efd688df10e369fd","observation_id":"9b9772bb-683c-4563-8847-1e8b248f6754","resolution":{"observed_at":"2026-08-07T05:45:31.146028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:30.627374Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.627374Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:88c2650e13f5c783bcd890a628f8fda96304c86fd2ce1cddaa3e8b8698e17f33","observation_id":"92032de7-d6d7-48c5-9a3f-a5cf9317df0b","resolution":{"observed_at":"2026-08-07T05:45:30.627374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-07T05:45:30.631557Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v.arXiv preprint arXiv:2310.11441, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.631557Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:4f9057517ea6780287148f4f61efcb23f4a9b35afe28a2378b3ee011baedbc99","observation_id":"b523a58f-2eef-46ee-b336-3950e403d8e8","resolution":{"observed_at":"2026-08-07T05:45:30.631557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12058","last_updated":"2024-02-19T11:23:53Z","snapshot_observed_at":"2026-07-06T17:32:10.828230Z","submitted_at":"2024-02-19T11:23:53Z","title":"Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12058","snapshot_observed_at":"2026-08-07T05:45:30.635922Z","title":"Scaffolding coordinates to promote vision-language coordination in large multi-modal models.arXiv preprint arXiv:2402.12058, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.635922Z"},"links":{"cited_paper":"/paper/2402.12058","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:dcfa011d4dc6d6d7cf50bfbcf4050c88dab56152b7f6d59999250127b05726d3","observation_id":"bf3df506-9ebc-4103-a789-956e840cebd0","resolution":{"observed_at":"2026-08-07T05:45:30.635922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-07T05:45:30.640388Z","title":"Mm-react: Prompting chatgpt for multimodal reasoning and action","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.640388Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:90b5fe9f02543263d867dbc12fe26c22462d8aeab2073b5d87f331d01bf420bf","observation_id":"dcf6d6da-1844-4d90-a1f5-fa4898a2e6f5","resolution":{"observed_at":"2026-08-07T05:45:30.640388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:30.644103Z","title":"Making language models better reasoners with step-aware verifier","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.644103Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:861ec52d71d213f31ee6facaec7252dbf9aaa1d79fc340fd68679ba3e884d21a","observation_id":"fc168fb3-3060-4879-b51d-a94c1a8661d8","resolution":{"observed_at":"2026-08-07T05:45:30.644103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:30.648369Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.648369Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:4e8485e0c5a60f3931d8b5ad77d2564034fc62a5a6ae6587b2cdb5ae5686439f","observation_id":"cb1f1667-6ae4-482e-a7ad-06dfc7a1262a","resolution":{"observed_at":"2026-08-07T05:45:30.648369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.105905Z","title":"Solving math word problems via cooperative reasoning induced language models","venue":null,"work_id":"a34c2020-e7d4-4f61-9314-57677845da7c","year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.652126Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:de6d189dd796be84a7040da0dfa682a2fb5855ffec6d7c5e4531d3cd296a1d58","observation_id":"3e4fe20d-b57c-481a-b5cd-c493fd0e6d42","resolution":{"observed_at":"2026-08-07T05:45:31.109578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10080","last_updated":"2023-10-16T05:21:50Z","snapshot_observed_at":"2026-08-10T06:54:39.880929Z","submitted_at":"2023-10-16T05:21:50Z","title":"Let's reward step by step: Step-Level reward model as the Navigators for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10080","snapshot_observed_at":"2026-08-07T05:45:30.655336Z","title":"Let’s reward step by step: Step-level reward model as the navigators for reasoning.arXiv preprint arXiv:2310.10080, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.655336Z"},"links":{"cited_paper":"/paper/2310.10080","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:ea9c9477f3371c992b4604024f7610fef4081663cc56019b0384f9591ec58bfc","observation_id":"fb622090-c761-4f60-8374-09194f456762","resolution":{"observed_at":"2026-08-07T05:45:30.655336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-07T05:45:30.658831Z","title":"Math-shepherd: A label-free step-by-step verifier for llms in mathematical reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.658831Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:9819ae1e55ed0a8256b76a5cc32f73ba6acce4dd41fade212d2cb17c7dd60f09","observation_id":"2e143f65-c3c8-497e-892e-f6efc4614f71","resolution":{"observed_at":"2026-08-07T05:45:30.658831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T05:45:30.662617Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.662617Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:7a8ddf35b93c4c5ffb07af64878ccc1c62a9fe6dd7e48589e6d36c5d4ee4a5a7","observation_id":"68ac5975-e95e-4064-b93e-b95e536655c7","resolution":{"observed_at":"2026-08-07T05:45:30.662617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.093747Z","title":"Rlcd: Reinforcement learning from contrastive distillation for lm alignment","venue":null,"work_id":"d4036af0-db0d-49e1-86e2-2e20349f0e38","year":null},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.666869Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:3017fdcef8181d97815ab5dd817d52459114783381778a2209e0a1103c155b0b","observation_id":"184ebd8e-b7e4-47db-80de-756321b7cf7b","resolution":{"observed_at":"2026-08-07T05:45:31.097704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.080991Z","title":"Pretraining language models with human preferences","venue":null,"work_id":"675dabf2-ac6e-47ba-9d01-1448454a6f9d","year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.671380Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:2c6d4816d99c23aab5b5e580ed82757bd14252048d28bc7b50d75583dc52d155","observation_id":"3ba739d5-16d2-4232-bc94-8f028c22e319","resolution":{"observed_at":"2026-08-07T05:45:31.084696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10047","last_updated":"2023-10-16T04:11:19Z","snapshot_observed_at":"2026-07-06T16:33:30.170449Z","submitted_at":"2023-10-16T04:11:19Z","title":"Improving Large Language Model Fine-tuning for Solving Math Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10047","snapshot_observed_at":"2026-08-07T05:45:30.675404Z","title":"Improving large language model fine-tuning for solving math problems.arXiv preprint arXiv:2310.10047, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.675404Z"},"links":{"cited_paper":"/paper/2310.10047","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:cb0b5d096599c701b3f0a2f911f43dbb81411e743b859e66ef1709344a213a62","observation_id":"cdee5b0e-b45c-4eef-b8b3-e02f34ede260","resolution":{"observed_at":"2026-08-07T05:45:30.675404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06457","last_updated":"2024-08-14T02:41:48Z","snapshot_observed_at":"2026-07-06T17:28:02.037844Z","submitted_at":"2024-02-09T15:02:56Z","title":"V-STaR: Training Verifiers for Self-Taught Reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06457","snapshot_observed_at":"2026-08-07T05:45:30.679605Z","title":"V-star: Training verifiers for self-taught reasoners.arXiv preprint arXiv:2402.06457, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.679605Z"},"links":{"cited_paper":"/paper/2402.06457","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:33ab790815d2c5ec9d4f5fba0c99e9ba17ec017dbcb0f3388384fa58bf4bc651","observation_id":"b221ca03-9306-44e2-b182-2b87ba767138","resolution":{"observed_at":"2026-08-07T05:45:30.679605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02392","last_updated":"2025-02-27T22:10:16Z","snapshot_observed_at":"2026-08-02T09:51:41.216056Z","submitted_at":"2024-09-04T02:41:04Z","title":"Building Math Agents with Multi-Turn Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02392","snapshot_observed_at":"2026-08-07T05:45:30.683409Z","title":"Building math agents with multi-turn iterative preference learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.683409Z"},"links":{"cited_paper":"/paper/2409.02392","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:17c4a717909d8bfd3a0eda10339950ad12acac43005c177affc521826c12b5d8","observation_id":"0e2ad5c0-c823-4ec9-b278-869e749f1dc5","resolution":{"observed_at":"2026-08-07T05:45:30.683409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T05:45:30.687744Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.687744Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:805ba65b82dcc9cdfd73e93d765f8ca4142d28118370b10116e43ed764d887d3","observation_id":"4bde0720-d8c2-4b59-923e-cfb12b1e46bc","resolution":{"observed_at":"2026-08-07T05:45:30.687744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T05:45:30.691615Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.691615Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:757ff121684b0daee8ab0716442304fe5c3e5830413f8341d09b82ba347f2b2b","observation_id":"7a1641a5-f9cd-41d4-b1f7-03d615ea423b","resolution":{"observed_at":"2026-08-07T05:45:30.691615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T05:45:30.694953Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.694953Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:5bca223f43a2937a9ea1cc7495e2675efe06453346619f86935940053bd90cf3","observation_id":"5afb27e4-9bc5-454f-a275-f37192943a9f","resolution":{"observed_at":"2026-08-07T05:45:30.694953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T05:45:30.698822Z","title":"Are we on the right way for evaluating large vision-language models?arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.698822Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:2bccbdab2366d490731c5ea65194dd5cb44f5cffe9e4631932c3a8c1e60d1dd1","observation_id":"f957249a-e9a8-470d-837c-08b495156d34","resolution":{"observed_at":"2026-08-07T05:45:30.698822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T05:45:30.702326Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.702326Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:da2ec5903f0aff906c94ec0e26c7a3782c5804064f364198e7fc58ec375aefbe","observation_id":"459c0db6-b89b-4b85-948e-7185cb7681f2","resolution":{"observed_at":"2026-08-07T05:45:30.702326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-08T00:55:20.148284Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18072","snapshot_observed_at":"2026-08-07T05:45:30.706182Z","title":"Mmfactory: A universal solution search engine for vision-language tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.706182Z"},"links":{"cited_paper":"/paper/2412.18072","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:95869fb5ac15e3621110286418ce1c853ee23c8094cb2dc0bdc63d086500f046","observation_id":"65f1e13d-11f2-4578-9337-f6ffec9cf394","resolution":{"observed_at":"2026-08-07T05:45:30.706182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:30.709569Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.709569Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:0052e93f38ad8e84d3157a267140fbb4d3bd731082356d92d9c570b1582cb353","observation_id":"0d54322b-c595-4edf-bbea-a1c08399fd84","resolution":{"observed_at":"2026-08-07T05:45:30.709569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:30.712751Z","title":"Mathematical analysis of machine learning algorithms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.712751Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:db26a3fb9107fbfa5d0d3331e25be249c851850a191940f5340e77e62d9d35e5","observation_id":"2c26b258-5e7b-4a1b-8917-bd377116f215","resolution":{"observed_at":"2026-08-07T05:45:30.712751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.052500Z","title":"Probability: theory and examples, volume 49","venue":null,"work_id":"c7f4213e-0b8c-43e3-abdc-503c1aeafda3","year":2019},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.716671Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:41c4c2c57efbd79b9a33796876f68e0dc14f9543f3efcdcdd8a7535eb7f8e5b8","observation_id":"1fbb9cad-42c1-4b29-9652-ca3470c1e0c0","resolution":{"observed_at":"2026-08-07T05:45:31.056031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.039370Z","title":null,"venue":null,"work_id":"b5ae90ab-1915-4174-b1ed-bd2c9828291d","year":null},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.720489Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:cf5a0a531cd87addee428cec815ea7e09efba5ec74093c5b0aa571498d72c7e6","observation_id":"cd360758-56b3-4fd2-a23a-6f26d30c2e42","resolution":{"observed_at":"2026-08-07T05:45:31.043147Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.023548Z","title":"If in the last definition,= is replaced by ≤ or ≥, then Xn is said to be a supermartingale or submartingale, respectively","venue":null,"work_id":"cd2cf942-f1e5-49ea-b9e8-7f37da8a2fc3","year":null},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.723796Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:6c215a4d28e4b54f24e9df1a822595dfd3a4ebc924e7fb93760500fc833e9d61","observation_id":"44af0ef1-f44d-4789-b130-ec622744a4b5","resolution":{"observed_at":"2026-08-07T05:45:31.028048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.012427Z","title":null,"venue":null,"work_id":"6c9a5635-7615-4e61-8dc2-266319901896","year":null},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.727319Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:3a1229f9aeace83307e9c3951da6a57d85852c2f586ba25fe4970aa19dc60fb2","observation_id":"5c9b9790-6d33-471b-99e3-7bde2da9912d","resolution":{"observed_at":"2026-08-07T05:45:31.015628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:31.000820Z","title":null,"venue":null,"work_id":"beccf2d4-1c26-4343-acbd-e1e830bcb8c6","year":null},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.731168Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:47951284c4de60eab61df079a60cc0ffea1743166a11e462a5d45244f6356a34","observation_id":"8af02ebc-195d-427a-b337-ca2f411af61f","resolution":{"observed_at":"2026-08-07T05:45:31.004160Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:45:30.986603Z","title":"log V ˆϕSDPO (th | sh) Vϕ0 (th | sh) +log V ˆϕSDPO (ah | th) Vϕ0 (ah | th) # . Observe that condition (ii) implies that Eth∼R ˆθSFT(·|sh)","venue":null,"work_id":"8e52bcdd-1ae3-4e34-b0d0-73d7eb1b3c01","year":null},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.735139Z"},"links":{"citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:fd9e766a53ac9578b2378539c2f45b1eec043c50770d2fb513c7c177710ed5c8","observation_id":"5c19b0e8-7570-4206-92b9-a2fd8c9ccfca","resolution":{"observed_at":"2026-08-07T05:45:30.992308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":27,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 8 inbound Pith citation observations for arXiv:2506.07235."}