{"as_of":"2026-08-18T04:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:013827487885aef1594a575666493a3300ad19d0c57708e6301829600a48a008","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:40:13.423620Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:39:18.945567Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T13:23:28.446166Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10128","snapshot_observed_at":"2026-08-15T18:39:18.945567Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00045","last_updated":"2025-06-23T22:05:21Z","snapshot_observed_at":"2026-08-17T10:09:09.151734Z","submitted_at":"2025-06-23T22:05:21Z","title":"CaughtCheating: Is Your MLLM a Good Cheating Detective? Exploring the Boundary of Visual Perception and Reasoning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T18:39:18.945567Z"},"links":{"cited_paper":"/paper/2506.10128","citing_paper":"/paper/2507.00045"},"observation_digest":"sha256:759b37925896284ed1803090fd811766799c6ca75af7685ab131fc2552ae7062","observation_id":"fd00f03b-0e85-4a46-a5f8-0b937a4a4f66","resolution":{"observed_at":"2026-08-15T18:39:18.945567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10128","snapshot_observed_at":"2026-08-05T13:24:39.864757Z","title":"Vicrit: A verifiable reinforcement learning proxy task for visual perception in vlms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.864757Z"},"links":{"cited_paper":"/paper/2506.10128","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:408967954c79f9824e132670257f68700a7c477358418a294be4925f7047c8ce","observation_id":"9baea096-df66-4209-84a4-cc84c740d227","resolution":{"observed_at":"2026-08-05T13:24:39.864757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10128","snapshot_observed_at":"2026-08-04T16:07:42.673501Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":182,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:42.673501Z"},"links":{"cited_paper":"/paper/2506.10128","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:1a1ee63b7e2881311e97a7552e628ea573522a05b6e6177b7f66fefbcd07e490","observation_id":"c1007e17-2e9d-42c4-b6b4-27490a6c1045","resolution":{"observed_at":"2026-08-04T16:07:42.673501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"cited_work":{"arxiv_id":"2506.10128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10128","snapshot_observed_at":"2026-06-29T13:23:28.446166Z","title":"Vicrit: A verifiable reinforcement learning proxy task for visual perception in VLMs.ArXiv preprint, abs/2506.10128, 2025","venue":null,"work_id":"0114027b-29c6-4039-9821-cd99a3693e3a","year":2025},"citing_paper":{"arxiv_id":"2605.28023","last_updated":"2026-05-27T06:27:04Z","snapshot_observed_at":"2026-08-02T21:20:31.316522Z","submitted_at":"2026-05-27T06:27:04Z","title":"VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T13:13:57.599970Z"},"links":{"cited_paper":"/paper/2506.10128","citing_paper":"/paper/2605.28023"},"observation_digest":"sha256:863dd3bfe26168c5ccbf1a7fdcbeed84596ce2e8603e83f724bd9d84c1b9470c","observation_id":"3997fe41-a744-4773-a272-8bbe15188270","resolution":{"observed_at":"2026-06-29T13:23:28.447802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10128","snapshot_observed_at":"2026-07-12T11:31:14.532101Z","title":"Vicrit: A verifiable reinforcement learning proxy task for visual perception in vlms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02551","last_updated":"2026-06-26T16:05:57Z","snapshot_observed_at":"2026-08-17T17:47:52.705809Z","submitted_at":"2026-06-26T16:05:57Z","title":"DELTAVID: Enhancing Fine-Grained Spatiotemporal Perception with Cross-Video Differences","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T11:31:14.532101Z"},"links":{"cited_paper":"/paper/2506.10128","citing_paper":"/paper/2607.02551"},"observation_digest":"sha256:05ddee9590cc7def9d91f3eda57f2e7f8ea3529c6a59e13eb2737cd0a0a3521b","observation_id":"f3d4dad6-963e-43b0-a461-ffe4a4862636","resolution":{"observed_at":"2026-07-12T11:31:14.532101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10128","snapshot_observed_at":"2026-08-01T11:47:27.425487Z","title":"ViCrit: A verifiable reinforcement learning proxy task for visual perception in VLMs.arXiv preprint arXiv:2506.10128, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:27.425487Z"},"links":{"cited_paper":"/paper/2506.10128","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:8e06f1f5efbb2aa30b5c8a22e88e59ce89c20d1c7c43a71f761904df2ab3358f","observation_id":"5d28c6f6-f5b3-443a-99e4-67578dd105ef","resolution":{"observed_at":"2026-08-01T11:47:27.425487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.10128/citation-record","integrity":"/paper/2506.10128/integrity","json":"/paper/2506.10128/citation-record.json","paper":"/paper/2506.10128"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:17.966833Z","title":"Vqa: Visual question answering","venue":null,"work_id":"b05ab0e4-fae5-4b9d-bad5-111d93f8a84b","year":2015},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:06.644920Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:8b9df90d521c89094df9d22323478e068d797ccedf49821c346eb2bae51f9330","observation_id":"529e2bc9-2351-42ea-a4c2-476f671be824","resolution":{"observed_at":"2026-08-07T04:40:18.085418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07461","last_updated":"2024-11-12T00:52:52Z","snapshot_observed_at":"2026-08-16T13:00:58.647030Z","submitted_at":"2024-11-12T00:52:52Z","title":"BLIP3-KALE: Knowledge Augmented Large-Scale Dense Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07461","snapshot_observed_at":"2026-08-07T04:40:06.691389Z","title":"Blip3-kale: Knowledge augmented large-scale dense captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:06.691389Z"},"links":{"cited_paper":"/paper/2411.07461","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:0914c0bd794ba492388ecc446b25beb04ab50abda2be18c891b354c90b65d7f2","observation_id":"b187ba96-3bfb-41b1-907c-2d4870c92b3a","resolution":{"observed_at":"2026-08-07T04:40:06.691389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T04:40:06.769409Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:06.769409Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:619df7a164a4b932854c28c3c1e37fcaaa0cb03eaa2cebe022bf45bb184a9225","observation_id":"295ab65c-4f3b-437d-a1cc-28902ee60831","resolution":{"observed_at":"2026-08-07T04:40:06.769409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:06.852093Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:06.852093Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:66dcedcca5fef290be0ff2775a5ca20abf544150f777e668f0320a5b31936bc7","observation_id":"0b6f18c6-6c7c-4c55-8a25-776297f6b43e","resolution":{"observed_at":"2026-08-07T04:40:06.852093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:06.950928Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:06.950928Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:784b8aaa033040461a873340a89feb39c0d98294639f576afc38405f1ce05322","observation_id":"61c4cd51-1079-4709-8a57-8f561729cab0","resolution":{"observed_at":"2026-08-07T04:40:06.950928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:17.612452Z","title":"R1-v: Reinforcing super generalization ability in vision language models with less than \\ 3","venue":null,"work_id":"6217b4bd-ca22-4103-ae13-b28f5c0b3405","year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.055773Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:910fa36fc18b9da532749bd3290c4adedeb42a192784d3b79b3717f4e390522f","observation_id":"e148fb5c-6010-4a9d-ac4b-2882ddc5bda8","resolution":{"observed_at":"2026-08-07T04:40:17.814290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:17.326066Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":"d119956b-16c6-4d46-916d-44ccd38ffc9a","year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.167181Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:6115abf36302a4ac36a96a9ced06630d8b9673dbaa768d8b450d39d2f220b01f","observation_id":"b165f18e-9ec9-4319-b4ae-01800a07b4a2","resolution":{"observed_at":"2026-08-07T04:40:17.479967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T04:40:07.282039Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.282039Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:305bdc12f38bc77d4d9a0850b54ac752e036c8adeb3de4142ed36a2433029dd7","observation_id":"16c87061-4b08-42b8-9650-ddbf4263dfbf","resolution":{"observed_at":"2026-08-07T04:40:07.282039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T04:40:07.352289Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.352289Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:fa9815cf49818833521618be1b8b60fca4a61d6f057f5e5a63b44648329447ad","observation_id":"4278674d-e3d4-47ce-97c4-9aa33a023f0a","resolution":{"observed_at":"2026-08-07T04:40:07.352289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:07.423678Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.423678Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:9f64c019064f52d74a7daffb5c612b3b73dd66271fa073df2f8d8eaf04ca4106","observation_id":"0f547de1-4259-4664-ae43-04fc56b9f4fd","resolution":{"observed_at":"2026-08-07T04:40:07.423678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T04:40:07.530509Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.530509Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:b8a4cc26b17bc9357f87d694425958bd1186f40eed74fce2251de2bb248c168d","observation_id":"ecfc56bd-d7c3-441d-89cc-0496c50d2888","resolution":{"observed_at":"2026-08-07T04:40:07.530509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-07T04:40:07.610397Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.610397Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:17cd52eb3029b4e10a6fcba1f3cf729540fc6224a4911e63b229ab42c77b895d","observation_id":"dbfc9be6-f678-4ffe-b456-45023e87f0ef","resolution":{"observed_at":"2026-08-07T04:40:07.610397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:17.080227Z","title":"Enhancing large vision language models with self-training on image comprehension","venue":null,"work_id":"f6445dc4-3345-4d8c-8f56-e6439d467145","year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.695543Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:e23872a4b5428476d15602934de55a6fa55e1fcb0e73ec5bc704645bacf966cb","observation_id":"6d3f5767-fb1f-4614-8730-bdcd5fdd560e","resolution":{"observed_at":"2026-08-07T04:40:17.196649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-07T04:40:07.764980Z","title":"Openvlthinker: An early exploration to complex vision-language reasoning via iterative self-improvement, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.764980Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:a359a2c949b0937e6d2329613f5408dbc2b5f92a4264437d7e1bc1258dbe4510","observation_id":"c9ae7c9d-2336-4ce8-a60a-05d82a6a63b4","resolution":{"observed_at":"2026-08-07T04:40:07.764980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:16.813832Z","title":"Virtex: Learning visual representations from textual annotations","venue":null,"work_id":"f90c6982-6ed9-45f4-853c-bf0b92718bdf","year":2021},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.899067Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:81fc9a0b44e76e6f1b6b10b07c4f4bd0df4f43f96e85f9a5b89a5d36e24ac479","observation_id":"0af995ae-2b43-48e2-804f-57696d41c56e","resolution":{"observed_at":"2026-08-07T04:40:16.922173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-18T04:15:34.338725Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-08-07T04:40:07.980626Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.980626Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:78cbe1e108b0e31c3b537b9f00d1bd5ad51be291e9c0549adac7eccfff2d4a00","observation_id":"22bcc49e-abe1-4239-a509-8b6c2363d5ac","resolution":{"observed_at":"2026-08-07T04:40:07.980626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T04:40:08.094721Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.094721Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:8418cdbe393c074d991a0e1f94d1bc0f9344fae02e4520642e97c8aab911e095","observation_id":"57b69c66-5c8e-451d-b509-23db3c4f7fb6","resolution":{"observed_at":"2026-08-07T04:40:08.094721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-18T04:15:44.692958Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T04:40:08.211304Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.211304Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:adfdb0c840821451585898a6de56e6e8d6c9bed07492d7dd11d8a7b14db27b18","observation_id":"9024f7a6-09d5-44b8-a2c3-b8d1e33ac7af","resolution":{"observed_at":"2026-08-07T04:40:08.211304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:16.594654Z","title":"Measuring mathematical problem solving with the math dataset, 2021","venue":null,"work_id":"f0ff8684-797e-4b72-95b9-ef354da0575c","year":2021},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.309188Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:6e2cb79161c2ffed88c8324160485fc455ba3b97b8de071083d9fb925c9896f4","observation_id":"4a3b41b7-8ec1-4758-af92-85adf205d4fd","resolution":{"observed_at":"2026-08-07T04:40:16.696254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-16T02:03:48.252223Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T04:40:08.388160Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.388160Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:38783e9f028c48560bc43c5c6f15b5147f68f37a75cf0c16d2a4b53b207e989e","observation_id":"a280af47-a3c9-45c7-aff0-7c06e02d297f","resolution":{"observed_at":"2026-08-07T04:40:08.388160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:08.503288Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.503288Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:e8f0ca9769d222287724b3875e86271cac7b889b67694683d90752c6ba6460d3","observation_id":"d93473b7-9c98-41ff-b8f5-0e2bc50c2d90","resolution":{"observed_at":"2026-08-07T04:40:08.503288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T04:40:08.599239Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.599239Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:08b436a2abf4c58aeb0eba88d491b285060ae2a42310109b9a3976f906671bde","observation_id":"ff924b2c-8786-46bf-8965-ee35e28c2680","resolution":{"observed_at":"2026-08-07T04:40:08.599239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T04:40:08.696397Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.696397Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:bce8bf27aff4eeaede63aa78b702cd17dceb7a971e556695c2f8aec4ce237b07","observation_id":"55ce0b4f-f7f3-49ef-b31a-191a7cb46f55","resolution":{"observed_at":"2026-08-07T04:40:08.696397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07103","last_updated":"2024-10-03T13:55:08Z","snapshot_observed_at":"2026-08-16T14:02:01.627241Z","submitted_at":"2024-04-10T15:41:53Z","title":"Graph Chain-of-Thought: Augmenting Large Language Models by Reasoning on Graphs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07103","snapshot_observed_at":"2026-08-07T04:40:08.808188Z","title":"Graph chain-of-thought: Augmenting large language models by reasoning on graphs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.808188Z"},"links":{"cited_paper":"/paper/2404.07103","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:a274bade51dd8534133f1c2538ec6e54872d7f2f4f95f03489d5d4aaa1181248","observation_id":"01e4d8dd-532b-4c51-b697-43c1f4837be4","resolution":{"observed_at":"2026-08-07T04:40:08.808188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:08.912895Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.912895Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:1ac436b56e33b3791d8fa7886a902a6911df0162377d24dd7ae66a169ecadacd","observation_id":"4fcdadb3-48e7-4df2-a402-d1309441b60a","resolution":{"observed_at":"2026-08-07T04:40:08.912895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:08.994633Z","title":"Mawps: A math word problem repository","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:08.994633Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:62058aaa4ee4e853657b60b3cd7c6335ca29b6f918f4848772c1bc5185c416c1","observation_id":"e728da3d-5c57-40c5-aa2b-ff39f97320fe","resolution":{"observed_at":"2026-08-07T04:40:08.994633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T04:40:09.073387Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:09.073387Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:546eb3934e800bd0cf1e4b9e32139450bc6ec04e36e335c6ad42b3ae89c293cf","observation_id":"30fd708f-6fe5-4f35-a70a-d1d0c37805a5","resolution":{"observed_at":"2026-08-07T04:40:09.073387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:16.323144Z","title":"Multimodal foundation models: From specialists to general-purpose assistants","venue":null,"work_id":"b5e0d72b-c1dc-4db8-9cd7-ff31247be4ed","year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:09.168271Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:f0d88fd33f21e8ef9340f6922d76c858cc52e42f0dfc413050b562a7b6c5c590","observation_id":"38288d0a-69ec-4b66-b564-7c40f6460735","resolution":{"observed_at":"2026-08-07T04:40:16.437363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16072","last_updated":"2025-04-22T17:51:41Z","snapshot_observed_at":"2026-08-16T11:08:55.215309Z","submitted_at":"2025-04-22T17:51:41Z","title":"Describe Anything: Detailed Localized Image and Video Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16072","snapshot_observed_at":"2026-08-07T04:40:09.244875Z","title":"Describe anything: Detailed localized image and video captioning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:09.244875Z"},"links":{"cited_paper":"/paper/2504.16072","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:64cd2aaadac23968386978519cef1faa434af1768140132b3921434a00b7da4d","observation_id":"9f99e18b-c7a3-42f5-8ecf-e7e4d906f080","resolution":{"observed_at":"2026-08-07T04:40:09.244875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T04:40:09.313417Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:09.313417Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:d265ec52debed1e0e3c7cca5afcdeb40b8b390414aebd6b37ac22bacf62de74c","observation_id":"95ca5810-2016-4a10-94ba-bc9b988f8388","resolution":{"observed_at":"2026-08-07T04:40:09.313417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:09.436777Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:09.436777Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:b3e9cff5ed3aa1457184fc454b0c45a70ac483c0779a67aab5c8d2bbde81c29c","observation_id":"41609576-8914-4c4a-8c88-98c69927a580","resolution":{"observed_at":"2026-08-07T04:40:09.436777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:16.052839Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"15c23f8a-516c-41a1-8021-cb51a0e8a26f","year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:09.523923Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:168e6cfbf2544f25321679e66505705936b3cbb80cb5c50ac40f24a8290783c7","observation_id":"290e02e6-bfd3-4282-b57a-f67afa3e8367","resolution":{"observed_at":"2026-08-07T04:40:16.179830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:15.845720Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"80d5894f-f6a9-49ce-ad01-d18e6ab4569b","year":2022},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:09.582883Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:60c08f58d9ebbd5d6e74d0bc8b766d8abf29c236f94d119f47c1821b5c425766","observation_id":"f4f3460a-ac9d-45af-b995-8b5b62531ca1","resolution":{"observed_at":"2026-08-07T04:40:15.949313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:09.661306Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:09.661306Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:1109d9e865cc14e59e0bf0c5b633fd2234ef8089a475f8035ffe5ab76dbe3fbd","observation_id":"a16ab06f-44fb-40d8-819f-5b49a4350f77","resolution":{"observed_at":"2026-08-07T04:40:09.661306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00067","last_updated":"2019-09-04T10:43:20Z","snapshot_observed_at":"2026-08-14T16:22:47.713229Z","submitted_at":"2019-05-31T20:29:01Z","title":"OK-VQA: A Visual Question Answering Benchmark Requiring External Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00067","snapshot_observed_at":"2026-08-07T04:40:09.721963Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:09.721963Z"},"links":{"cited_paper":"/paper/1906.00067","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:f7637625e2b97c415d2160d4810c01497d1572628d5e16bccece2d6cd1560956","observation_id":"f3d4d0d7-fb17-48da-bc52-bc06a535396e","resolution":{"observed_at":"2026-08-07T04:40:09.721963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-13T20:16:31.803514Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T04:40:09.920757Z","title":"Mm-eureka: Exploring visual aha moment with rule-based large-scale reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:09.920757Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:0599765dd83b28b612d3e13c97b382cec5e0933bbd7693dd64b21ce3050c467e","observation_id":"6bb0b974-fd24-4e7b-bed7-a382064bb313","resolution":{"observed_at":"2026-08-07T04:40:09.920757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12115","last_updated":"2025-05-29T23:07:34Z","snapshot_observed_at":"2026-08-16T12:57:36.095391Z","submitted_at":"2025-02-17T18:41:16Z","title":"SWE-Lancer: Can Frontier LLMs Earn $1 Million from Real-World Freelance Software Engineering?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12115","snapshot_observed_at":"2026-08-07T04:40:10.021002Z","title":"Swe-lancer: Can frontier llms earn \\ 1 million from real-world freelance software engineering? arXiv preprint arXiv:2502.12115, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.021002Z"},"links":{"cited_paper":"/paper/2502.12115","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:baf13f2bfaac2a64a14246619583b12ed2180035de159ffb5e1132534b47c30a","observation_id":"d39a454f-ee62-445b-b7b6-4257d893cb8e","resolution":{"observed_at":"2026-08-07T04:40:10.021002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T04:40:10.113399Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.113399Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:f004841a5179e2a5210a14e3f695b855cf37bf5a71e282ded46bb6794b8a4fa4","observation_id":"722d67f4-93c7-460a-a6be-ff80c6b107ed","resolution":{"observed_at":"2026-08-07T04:40:10.113399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19702","last_updated":"2025-05-26T08:54:14Z","snapshot_observed_at":"2026-08-13T21:02:05.551264Z","submitted_at":"2025-05-26T08:54:14Z","title":"Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19702","snapshot_observed_at":"2026-08-07T04:40:10.179618Z","title":"Point-rft: Improving multimodal reasoning with visually grounded reinforcement finetuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.179618Z"},"links":{"cited_paper":"/paper/2505.19702","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:a40a32fd595408f976902fb7e8ecd8266c834fe03f02dff33710879167ceb0e2","observation_id":"25071772-0c3a-415c-822f-7b225daad8ec","resolution":{"observed_at":"2026-08-07T04:40:10.179618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:15.602609Z","title":"American invitational mathematics examination (aime) 2024: Competition problems","venue":null,"work_id":"de4c9f79-5fcd-41d0-875b-eafda7c8d9b0","year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.250543Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:2e4be58aca22a3c51a6a95cbcd6f76886ad31065f92a3039d29cff1b871ad029","observation_id":"2adb2fad-fb06-4f7e-8be5-9b1f66733eff","resolution":{"observed_at":"2026-08-07T04:40:15.691239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:10.331609Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.331609Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:0fc1589388853f25c2c746a315e277c108a471954d5dc4bf999acd996d7b4136","observation_id":"37a766c3-8881-48b5-811e-16d0fdcefe63","resolution":{"observed_at":"2026-08-07T04:40:10.331609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.07191","last_updated":"2021-04-15T06:11:12Z","snapshot_observed_at":"2026-08-07T13:11:17.300265Z","submitted_at":"2021-03-12T10:23:47Z","title":"Are NLP Models really able to Solve Simple Math Word Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.07191","snapshot_observed_at":"2026-08-07T04:40:10.409957Z","title":"Are nlp models really able to solve simple math word problems? arXiv preprint arXiv:2103.07191, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.409957Z"},"links":{"cited_paper":"/paper/2103.07191","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:bdf8fe4ccc44cdbc7e232e241fb0ced3b6fdc56eed45f80e3cb8667816867453","observation_id":"1caae194-1900-484a-bbe1-021d5c4fa937","resolution":{"observed_at":"2026-08-07T04:40:10.409957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-07T04:40:10.484752Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.484752Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:d7cce4e28d1172f535c67c5f5033a47db199ff113b9af0b06304ebde9bf0f3de","observation_id":"daf7b12b-f92d-41f2-a761-5b29de60949c","resolution":{"observed_at":"2026-08-07T04:40:10.484752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:15.368246Z","title":"Connecting vision and language with localized narratives","venue":null,"work_id":"9ddec959-630c-45f6-90d8-32abe0abbaa9","year":2020},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.569209Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:910d01766a27ef5093c80bb7ddfdf340c2eb83541c2f1f204aa1d9ba23b40ae4","observation_id":"ff5c66e0-b5f7-4028-9bfd-dc9b592fb697","resolution":{"observed_at":"2026-08-07T04:40:15.460773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:10.655345Z","title":"Vision language models are blind","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.655345Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:8e9920744357ea0a20ad31b78366c265a909f95f3519e6a57f693e2e4656906a","observation_id":"b8f3a763-69aa-4b6a-a1fc-332c2d1c65c5","resolution":{"observed_at":"2026-08-07T04:40:10.655345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-16T11:34:00.114590Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-08-07T04:40:10.721223Z","title":"Object hallucination in image captioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.721223Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:d375b863ae5cb6f82d2382f354c9dcd066e459cf0e213e3dc56074e3ef28c163","observation_id":"6e65327d-6dad-4ae9-a7e2-549795a65948","resolution":{"observed_at":"2026-08-07T04:40:10.721223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-08-16T15:35:53.479154Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-07T04:40:10.790536Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.790536Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:2497f7c2d28e5cc41549f55d6d6fd2811c17df9d4b5352fdbd512ddceb15891b","observation_id":"d6973e5d-3d08-4214-bbe4-a5764c3ead37","resolution":{"observed_at":"2026-08-07T04:40:10.790536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:15.170919Z","title":"Learning visual representations with caption annotations","venue":null,"work_id":"eb411523-a9fb-49d1-ad7d-7086a882f2a6","year":2020},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.860273Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:6549873d76fb84f65d314b83c5c24578137e1b937faa7421fb0aaa73ef3ff937","observation_id":"5e318aa9-e996-4b3e-b39d-12ec4690f758","resolution":{"observed_at":"2026-08-07T04:40:15.227903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T04:40:10.915730Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:10.915730Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:8b5c96a58084c699d394343ab86e71e864ca2fea3c616719d7c5e902c7c7a2f9","observation_id":"5d4ac2c6-bece-4c01-bdd7-b0b8913054f9","resolution":{"observed_at":"2026-08-07T04:40:10.915730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:11.020825Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.020825Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:375152f75fe8c3fc8325236dd2fc75da200c9eb5d0b3346f7285a358d6e8bb3b","observation_id":"7de2822a-dbea-45c7-869b-77e795584691","resolution":{"observed_at":"2026-08-07T04:40:11.020825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-08-15T23:42:34.277075Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-07T04:40:11.110047Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.110047Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:dfcb90dad775bc74b30e34f5e528f4c9bc3f50cbf3dc9a1f73e921c54e30e12d","observation_id":"269f59d6-2c04-4850-a77f-cac1edfdf181","resolution":{"observed_at":"2026-08-07T04:40:11.110047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:11.186415Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.186415Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:4149df53dcdc6319b063c2389da9fee950c150e830ffc59cc298a280b7f1da16","observation_id":"60076ad4-8eca-49d0-9755-2c0751f93e70","resolution":{"observed_at":"2026-08-07T04:40:11.186415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:14.919347Z","title":"Image captioners are scalable vision learners too","venue":null,"work_id":"087e28b5-ff9d-40e3-b43b-eca9f76ed093","year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.255836Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:948facf836936fed3585d99b76530d787fed8ae6492f130472cbdf95bfe47178","observation_id":"4d1d6408-ca4f-4847-91fc-9ff115899846","resolution":{"observed_at":"2026-08-07T04:40:15.018460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-07T04:40:11.367240Z","title":"Solving math word problems with process-and outcome-based feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.367240Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:0c0ff2fa0db39c41e14ebfe3cf9ec02490004297ee54f9a7e5d5626088f70925","observation_id":"b64bb195-56a1-4555-9596-aaea9b217669","resolution":{"observed_at":"2026-08-07T04:40:11.367240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-07T04:40:11.443100Z","title":"Git: A generative image-to-text transformer for vision and language","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.443100Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:961b207d950f315f4dfd5431d2ffdfec08e9256b59ee5c56e9eb82f8f8299cb6","observation_id":"a3c4f7f1-599f-46c6-8676-c515b928c0cb","resolution":{"observed_at":"2026-08-07T04:40:11.443100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:11.511675Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.511675Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:a0661ba2dd8444d29aeb9617134e35816e1c5b6753c833fe0b4009b9998ba7a7","observation_id":"8964877a-7d06-4be7-a438-7545a15f4629","resolution":{"observed_at":"2026-08-07T04:40:11.511675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-14T10:08:59.886019Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-07T04:40:11.584688Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.584688Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:254da6831acebd6106eb3e490832cbf24ce9aa5706bc07cfbc9d77b793725789","observation_id":"6b811447-8545-46ff-98c8-3544f21aa077","resolution":{"observed_at":"2026-08-07T04:40:11.584688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15973","last_updated":"2025-02-08T21:50:41Z","snapshot_observed_at":"2026-08-16T13:49:35.405713Z","submitted_at":"2024-05-24T23:09:27Z","title":"Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15973","snapshot_observed_at":"2026-08-07T04:40:11.660360Z","title":"Enhancing visual-language modality alignment in large vision language models via self-improvement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.660360Z"},"links":{"cited_paper":"/paper/2405.15973","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:f9464069a3634d725df39cc0bb519d262cf120162c0a72cf4ae368cdbc36ffc8","observation_id":"677d734b-80d1-4bf2-b4ce-31d3dbac3d35","resolution":{"observed_at":"2026-08-07T04:40:11.660360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03704","last_updated":"2025-06-30T20:29:34Z","snapshot_observed_at":"2026-08-14T19:57:03.409333Z","submitted_at":"2024-12-04T20:35:07Z","title":"Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03704","snapshot_observed_at":"2026-08-07T04:40:11.741673Z","title":"Scaling inference-time search with vision value model for improved visual comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.741673Z"},"links":{"cited_paper":"/paper/2412.03704","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:3390db0bfaecce92c846716a5558fac0257c32221169abf8c2033bf896cacd8f","observation_id":"d0da67b2-01d5-4d05-a158-b71c70f17dfa","resolution":{"observed_at":"2026-08-07T04:40:11.741673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07934","last_updated":"2025-05-30T15:53:16Z","snapshot_observed_at":"2026-08-17T21:35:46.840544Z","submitted_at":"2025-04-10T17:49:05Z","title":"SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07934","snapshot_observed_at":"2026-08-07T04:40:11.821726Z","title":"Sota with less: Mcts-guided sample selection for data-efficient visual reasoning self-improvement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.821726Z"},"links":{"cited_paper":"/paper/2504.07934","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:34e02947fc4eba73ef23fca408f2fc82460ed3fb7b6cfe4ca7da1b643cbf1c35","observation_id":"a9559091-c7ca-459c-8da7-146301ceae8d","resolution":{"observed_at":"2026-08-07T04:40:11.821726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T04:40:11.940289Z","title":"Le, Ed H","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.940289Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:2ec57d1c04e2f02b27cc47b30d3f6631ae953db874d4ff466c0e6843ff6b694e","observation_id":"2110b634-0937-40a8-9cef-88c00df6502c","resolution":{"observed_at":"2026-08-07T04:40:11.940289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:14.673520Z","title":"Charxiv: Charting gaps in realistic chart understanding in multimodal llms","venue":null,"work_id":"6cacb6a2-e413-464e-80fc-c6e59334db35","year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:11.995421Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:c64f01915d496d80f82ed73947915b5289288395563622a85107f3c61bca9324","observation_id":"3b43b8ad-bc20-443f-a553-8b2bf2522a54","resolution":{"observed_at":"2026-08-07T04:40:14.800291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:12.078191Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.078191Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:239f10e634e8e6a87d95a1c8e88d13c041e9a87943f4e7c862b7fb5698b3f568","observation_id":"3b1d654c-9cee-49bc-a702-9e6a175e7a8f","resolution":{"observed_at":"2026-08-07T04:40:12.078191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:14.406812Z","title":"Grit: A generative region-to-text transformer for object understanding","venue":null,"work_id":"3c4401e5-4f8c-4785-a669-abcfc7d05939","year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.170101Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:8d87144f41fc75e50ed826c418f60b9492d78c4e16fefee407c3929d1765513a","observation_id":"54962dd3-54f6-4f1b-b9d8-8513fe06f20b","resolution":{"observed_at":"2026-08-07T04:40:14.545092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:14.190427Z","title":"Mind's eye of llms: Visualization-of-thought elicits spatial reasoning in large language models","venue":null,"work_id":"8b9a20f8-d69f-44d3-8070-bc905992e256","year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.229035Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:f6f612ee0ec9a245258284b90f9fd0d7971e818e2dcf926c990dfe3ad31a01c6","observation_id":"ecbdf432-dae1-4225-80a3-8e3fafb23c0e","resolution":{"observed_at":"2026-08-07T04:40:14.273757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00451","last_updated":"2024-06-17T22:11:49Z","snapshot_observed_at":"2026-08-16T13:56:19.546679Z","submitted_at":"2024-05-01T11:10:24Z","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00451","snapshot_observed_at":"2026-08-07T04:40:12.319293Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.319293Z"},"links":{"cited_paper":"/paper/2405.00451","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:87ab8214ea861dfc215a95501422203c64eb3107be7bf3d61225789dddcd0fe1","observation_id":"52378c17-6432-4034-b1cb-652c1758abaf","resolution":{"observed_at":"2026-08-07T04:40:12.319293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02712","last_updated":"2025-03-04T00:49:07Z","snapshot_observed_at":"2026-08-16T13:12:52.288371Z","submitted_at":"2024-10-03T17:36:33Z","title":"LLaVA-Critic: Learning to Evaluate Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02712","snapshot_observed_at":"2026-08-07T04:40:12.386906Z","title":"Llava-critic: Learning to evaluate multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.386906Z"},"links":{"cited_paper":"/paper/2410.02712","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:a68c91e702539e449ed14aa5d4ad47d2121f78d7f2a019bb1534726f814387de","observation_id":"b15cf5c1-0f16-4079-9e14-187d98653191","resolution":{"observed_at":"2026-08-07T04:40:12.386906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-08-17T12:24:00.878640Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-07T04:40:12.468494Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.468494Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:70fb2888d46ba516e29a94c5a07cf8fdfb6886f965cdbd3e425cd414339861cd","observation_id":"8006c40d-0ba6-455c-9cb8-4c07c34460d3","resolution":{"observed_at":"2026-08-07T04:40:12.468494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08541","last_updated":"2024-08-14T17:43:25Z","snapshot_observed_at":"2026-08-16T14:52:36.166508Z","submitted_at":"2023-10-12T17:34:20Z","title":"Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08541","snapshot_observed_at":"2026-08-07T04:40:12.565375Z","title":"Idea2img: Iterative self-refinement with gpt-4v (ision) for automatic image design and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.565375Z"},"links":{"cited_paper":"/paper/2310.08541","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:a67bb46786aa45e9c58849a514ca9b465e36bf65a38453de75747d21258cb762","observation_id":"e67b9949-c7f6-4feb-aa0c-0f818da0e6db","resolution":{"observed_at":"2026-08-07T04:40:12.565375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:12.641376Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.641376Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:85f47e23dd7d2c9daf94c4641ada84e649f1e47850c2e888450828dce4d17b57","observation_id":"8d3a5b4f-6365-49df-ad0d-e2fd06af8d16","resolution":{"observed_at":"2026-08-07T04:40:12.641376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-18T03:16:44.825874Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T04:40:12.722299Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.722299Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:3d92a62090f80c5c572246e83abddc945be77f85e246ea208713c7f95363bf33","observation_id":"8e004ac8-a322-4de4-a87a-5b0d3bacc28b","resolution":{"observed_at":"2026-08-07T04:40:12.722299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00765","last_updated":"2024-12-01T06:08:00Z","snapshot_observed_at":"2026-08-16T13:29:08.314650Z","submitted_at":"2024-08-01T17:59:54Z","title":"MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00765","snapshot_observed_at":"2026-08-07T04:40:12.782437Z","title":"Mm-vet v2: A challenging benchmark to evaluate large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.782437Z"},"links":{"cited_paper":"/paper/2408.00765","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:824590e5373ca0e967124ae40a5b22287042a60a5153b02af91a221b65523660","observation_id":"1764ca9d-63de-47ee-a84e-1487f08812a7","resolution":{"observed_at":"2026-08-07T04:40:12.782437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:12.843716Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.843716Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:b31217b3d84337f385eb206a4d3cdb8e7c4a8687a5f03b5b32bb321ba7893126","observation_id":"547fe278-652e-451d-879f-2af3e13b2ae0","resolution":{"observed_at":"2026-08-07T04:40:12.843716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-13T03:52:04.619847Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-07T04:40:12.908645Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? arXiv preprint arXiv:2403.14624, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.908645Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:709ed61eb7f899bdba31c72d614e752daec0a5b353d7f91e01bdb08acd1d5386","observation_id":"0e7a1d09-8551-47e3-bb06-3a9c18d20f65","resolution":{"observed_at":"2026-08-07T04:40:12.908645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-08-16T13:07:19.184083Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-07T04:40:12.982412Z","title":"Improve vision language model chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:12.982412Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:d0c8f2b4cf3570e39c60e020c31ac40e517e41f8009800b84a514df14fa28ea5","observation_id":"da366a1c-b9f7-4218-9d91-626a390921c3","resolution":{"observed_at":"2026-08-07T04:40:12.982412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:14.024794Z","title":"Multimodal chain-of-thought reasoning in language models","venue":null,"work_id":"f10c64ee-311d-44e4-b7db-c3a6868722f3","year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:13.071416Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:883e0ecf20b52cac44a04ce03cfa975cc9a9c2d6e70ce8dd95d75ab04bd10588","observation_id":"825be651-6293-4306-aa15-83976889b032","resolution":{"observed_at":"2026-08-07T04:40:14.087716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-08-12T14:56:35.025839Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-07T04:40:13.125288Z","title":"Swe-bench: Can language models resolve real-world github issues? arXiv preprint arXiv:2310.06770, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:13.125288Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:c7b6acf224946400821bbad5c0ee2ffb192d289c0f2983eb98714adda24a4d57","observation_id":"69ab859d-d281-4114-ba82-84a7bf3038d7","resolution":{"observed_at":"2026-08-07T04:40:13.125288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:40:13.207587Z","title":"Easyr1: An efficient, scalable, multi-modality rl training framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:13.207587Z"},"links":{"citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:1bfb8919363cbfaca606740d199e2d655fb12fb20aa9f528a98f3aed15e81e5b","observation_id":"1c4c4e5f-7d75-452b-8a3a-e4fc03ffd881","resolution":{"observed_at":"2026-08-07T04:40:13.207587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-08-10T21:21:50.749962Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-07T04:40:13.311339Z","title":"Aligning modalities in vision large language models via preference fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:13.311339Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:8377261f50dd782518d447980b5976ede033199b3a9a80c2d0ee0289d51aa235","observation_id":"addd42a4-9d0e-4b7d-883a-740d7ad3fc5d","resolution":{"observed_at":"2026-08-07T04:40:13.311339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14622","last_updated":"2024-11-02T02:51:51Z","snapshot_observed_at":"2026-08-16T13:50:10.927560Z","submitted_at":"2024-05-23T14:30:33Z","title":"Calibrated Self-Rewarding Vision Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14622","snapshot_observed_at":"2026-08-07T04:40:13.423620Z","title":"Calibrated self-rewarding vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:13.423620Z"},"links":{"cited_paper":"/paper/2405.14622","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:f32275ef4f24c304855dfedac144810879ebdc54f6bc7c600f76834e67a5ab47","observation_id":"833b404f-7f94-40e2-aa27-34de5a8f59f4","resolution":{"observed_at":"2026-08-07T04:40:13.423620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 6 inbound Pith citation observations for arXiv:2506.10128."}