{"as_of":"2026-08-20T06:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d9dc56067456b07ac3ef79bc4a627630a2adad0eaf2b2825b8b6856e543db4f","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:24:39.981501Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:56:01.952589Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:59:58.567326Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2512.21815","last_updated":"2026-06-29T08:03:34Z","snapshot_observed_at":"2026-08-11T15:48:09.383072Z","submitted_at":"2025-12-26T01:01:25Z","title":"High-Entropy Tokens as Multimodal Failure Points in Vision-Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T19:29:43.382392Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2512.21815"},"observation_digest":"sha256:6935965bda82d5c2941b19da00c7bf2869b16d165371f72e38e522e0815598ee","observation_id":"b27b417a-d61c-409b-9100-0b2d4f172ddb","resolution":{"observed_at":"2026-05-16T19:31:13.050244Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-08-03T14:05:25.733973Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21815","last_updated":"2026-06-29T08:03:34Z","snapshot_observed_at":"2026-08-11T15:48:09.383072Z","submitted_at":"2025-12-26T01:01:25Z","title":"High-Entropy Tokens as Multimodal Failure Points in Vision-Language Models","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:25.733973Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2512.21815"},"observation_digest":"sha256:a5c6082198c9439556209a232bbb666e2a7caf73a57481957c5a8ef59c017ad8","observation_id":"c68e6a67-1d50-4550-87ab-dd7ed69a86fe","resolution":{"observed_at":"2026-08-03T14:05:25.733973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2601.22297","last_updated":"2026-05-17T20:58:42Z","snapshot_observed_at":"2026-08-15T03:14:24.857495Z","submitted_at":"2026-01-29T20:21:44Z","title":"Learning from Self-Debate: Preparing Reasoning Models for Multi-Agent Debate","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T14:29:15.751497Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2601.22297"},"observation_digest":"sha256:9bf83777f6a2abddead309014ac3d0ae05b01d9d4d5bda59abbca5921ba7cc2c","observation_id":"9bdd290c-5381-40d6-bcbd-09890ecf0064","resolution":{"observed_at":"2026-05-21T14:30:13.790750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2604.05117","last_updated":"2026-04-06T19:22:48Z","snapshot_observed_at":"2026-08-10T20:58:01.238928Z","submitted_at":"2026-04-06T19:22:48Z","title":"Watch Before You Answer: Learning from Visually Grounded Post-Training","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T20:01:13.305374Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2604.05117"},"observation_digest":"sha256:344c49f278c1c59a14d057bc1498dcf2186ce9c1fc7dbbb5e5808bdaa590a065","observation_id":"b1a125c1-20ee-4954-a735-d66748f1417d","resolution":{"observed_at":"2026-05-10T22:15:51.701504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2604.19544","last_updated":"2026-04-21T15:02:50Z","snapshot_observed_at":"2026-08-13T04:51:40.506406Z","submitted_at":"2026-04-21T15:02:50Z","title":"DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T01:45:30.001398Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2604.19544"},"observation_digest":"sha256:faaabaac39876f62e95cd71f8b23925da914048d4695137011d82c4e60ff4a6f","observation_id":"d21428b6-34ea-44c6-b988-a1c1f5f3883e","resolution":{"observed_at":"2026-05-11T13:26:03.934946Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-08-15T22:24:27.472726Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:2bddd522e4be4e7d3d15c166c422cdef5806b66502dfd226e788cf7012694a71","observation_id":"9a247ef6-a82d-46aa-b669-1071141cac14","resolution":{"observed_at":"2026-05-11T13:36:08.805123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2605.05922","last_updated":"2026-05-12T06:25:12Z","snapshot_observed_at":"2026-08-13T06:19:40.782050Z","submitted_at":"2026-05-07T09:30:58Z","title":"Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T07:37:52.346280Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2605.05922"},"observation_digest":"sha256:5c23c141c1414ba7564e1b4d47a8be15846d5467d0749c511331c12f1cca0daa","observation_id":"f6e06dc6-c571-49a2-9719-de29a1412d78","resolution":{"observed_at":"2026-05-13T07:42:30.768132Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2605.07872","last_updated":"2026-05-08T15:29:11Z","snapshot_observed_at":"2026-08-14T18:07:54.937816Z","submitted_at":"2026-05-08T15:29:11Z","title":"Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T02:18:20.880231Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2605.07872"},"observation_digest":"sha256:af3d142a435418a609867d2684ecd1d64f44edbefc3da28a71318a439bf8e5b6","observation_id":"eb90c0cd-3b97-4812-80b6-710292ac054a","resolution":{"observed_at":"2026-05-11T03:45:58.496389Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2605.25571","last_updated":"2026-05-25T08:26:34Z","snapshot_observed_at":"2026-08-11T23:46:03.759864Z","submitted_at":"2026-05-25T08:26:34Z","title":"AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-29T22:56:39.504430Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2605.25571"},"observation_digest":"sha256:5ced60db7e6e3d7a7272157e145923378132e54ec2ce8b84196b1ea5ef08ed8a","observation_id":"bc854a1f-8dce-4537-9616-c1aebfd183d1","resolution":{"observed_at":"2026-06-30T00:14:04.651999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2606.25034","last_updated":"2026-06-26T07:24:58Z","snapshot_observed_at":"2026-08-08T01:07:51.075130Z","submitted_at":"2026-06-23T18:00:08Z","title":"Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T00:03:27.948225Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2606.25034"},"observation_digest":"sha256:c7cabbb7bd16ab7dd9e29cbbb72dec584aab47497917feefbef35065aaf38690","observation_id":"b631b8b4-6629-4e9c-b17c-c41a0306dd70","resolution":{"observed_at":"2026-07-04T16:59:58.569526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2606.25034","last_updated":"2026-06-26T07:24:58Z","snapshot_observed_at":"2026-08-08T01:07:51.075130Z","submitted_at":"2026-06-23T18:00:08Z","title":"Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T05:16:19.502837Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2606.25034"},"observation_digest":"sha256:9919b4ddc9616f73d838bd5d1cf3b05c3ff527f8eee98886216dac6762182772","observation_id":"15ec6608-c26e-403a-8397-d6582a6b4fc3","resolution":{"observed_at":"2026-06-29T18:03:48.808047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-08-02T03:20:41.208153Z","title":"arXiv preprint arXiv:2509.00676 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13931","last_updated":"2026-07-15T15:13:02Z","snapshot_observed_at":"2026-08-17T21:23:50.492349Z","submitted_at":"2026-07-15T15:13:02Z","title":"SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T03:20:41.208153Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2607.13931"},"observation_digest":"sha256:5a1988df3d9340493a9ae027f87a4a68d0b5f49a4783d0fa88e17146df303912","observation_id":"98c9f657-6b68-4eb6-8288-294bb38a9e9a","resolution":{"observed_at":"2026-08-02T03:20:41.208153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-08-01T17:47:42.427244Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:42.427244Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:c1e5d3837f7bd2f171380524977c4dd28d78c1bba37ec8dfe2eb4df15d7be1d4","observation_id":"c5a3c139-f196-4cae-aa08-cd8e0f2cc00a","resolution":{"observed_at":"2026-08-01T17:47:42.427244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-08-12T19:56:01.952589Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10665","last_updated":"2026-08-11T08:46:38Z","snapshot_observed_at":"2026-08-17T23:31:24.305106Z","submitted_at":"2026-08-11T08:46:38Z","title":"VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T19:56:01.952589Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2608.10665"},"observation_digest":"sha256:a67880e5981efeb76abedfc795340bb87d17c4e67b573a0e11526f70c13c6b93","observation_id":"456a6657-a62a-4bc1-8d2a-d16f12c85bb5","resolution":{"observed_at":"2026-08-12T19:56:01.952589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.00676/citation-record","integrity":"/paper/2509.00676/integrity","json":"/paper/2509.00676/citation-record.json","paper":"/paper/2509.00676"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T13:24:39.590118Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.590118Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:6166b2270d2f20141213ded3f7e7e3310b5d034d116778fb7ff5b77519f306bd","observation_id":"2fc229f3-c54a-4901-ad3e-1b51b820e4a1","resolution":{"observed_at":"2026-08-05T13:24:39.590118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-08-14T10:00:52.343929Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-05T13:24:39.596363Z","title":"Le, Christopher Ré, and Azalia Mirhoseini","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.596363Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:4ccc6fc06f724eb536de47892c534b93624031c99d815e40a1326a7cf624f0e1","observation_id":"b5727700-f78a-4c26-99df-12418ed65885","resolution":{"observed_at":"2026-08-05T13:24:39.596363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-05T13:24:39.601972Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.601972Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:3565d376a16b2fb1ee5261fd1ed8c3d588b8db64cdddc8168c71fbb947738bfb","observation_id":"5250fb7f-1788-47ef-9e57-2043d760ea48","resolution":{"observed_at":"2026-08-05T13:24:39.601972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-05T13:24:39.607386Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.607386Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:0fcefacdb4ccffea2ff9ea8468045d7ba626247a0bf9ca2faec32fb55cc29f9f","observation_id":"b0b34e68-9e88-4e54-865c-cba0aaa15173","resolution":{"observed_at":"2026-08-05T13:24:39.607386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-05T13:24:39.613659Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.613659Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:dac686c5ae4237f01265444582439cefdb5ee9efbab572d2467cdc557f10574c","observation_id":"6cb47259-c3aa-4b8a-b303-e66ff9a16ecf","resolution":{"observed_at":"2026-08-05T13:24:39.613659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.620300Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.620300Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:65cd5d8d43acfed06c9745eb4ecf4c4cde279bc800939ae8095cc34217b67a21","observation_id":"e84394d7-224c-45a2-b0ab-6454bf1f3611","resolution":{"observed_at":"2026-08-05T13:24:39.620300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-05T13:24:39.626362Z","title":"Openvlthinker: An early exploration to complex vision-language reasoning via iterative self-improvement, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.626362Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:41c3a70ae82e15ef9288c4e0472d9ffe915b7c597a292d5c6513412dcfe2d7d7","observation_id":"7fffd557-bb35-4f9b-bed8-0e1784643ed6","resolution":{"observed_at":"2026-08-05T13:24:39.626362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-20T02:50:01.167264Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T13:24:39.631783Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.631783Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:ac01ebf5d814f8dc04e54d8f93970f98026dea5b0e3f6e118f85101d6ebfb254","observation_id":"b3588781-8ee6-4566-963c-9e74225587a6","resolution":{"observed_at":"2026-08-05T13:24:39.631783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.637885Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.637885Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:a788a26e85332d3db439aedf097a44ddb20626e97283e17aba234de3ad2ee57c","observation_id":"71821fab-acc8-4ada-a812-97ad3ddfe4df","resolution":{"observed_at":"2026-08-05T13:24:39.637885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01707","last_updated":"2024-12-25T13:32:54Z","snapshot_observed_at":"2026-08-16T13:13:17.454194Z","submitted_at":"2024-10-02T16:15:31Z","title":"Interpretable Contrastive Monte Carlo Tree Search Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01707","snapshot_observed_at":"2026-08-05T13:24:39.642992Z","title":"Interpretable contrastive monte carlo tree search reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.642992Z"},"links":{"cited_paper":"/paper/2410.01707","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:1bba2c5f6e6d2f4c08464b002f208d8484faaf80f6245323dd04970d9600271c","observation_id":"7f011b7d-e72a-4d58-9801-99b13bf437fa","resolution":{"observed_at":"2026-08-05T13:24:39.642992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-19T10:24:15.607193Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-05T13:24:39.648950Z","title":"Hallusionbench: An advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.648950Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:8637dcbf06e866b226b221dcdecadb4e5a7292d4f4fc9b5cc77afda012c48868","observation_id":"d3971631-1abe-431e-9f16-cf3e1610741b","resolution":{"observed_at":"2026-08-05T13:24:39.648950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-18T04:15:44.692958Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-05T13:24:39.653975Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.653975Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:e7484e6dffe525a6c89a0fa318a389d17877f4e5cba0c02d3b185e692d73aa2c","observation_id":"aa570e30-2544-4fe1-8f67-24262a221426","resolution":{"observed_at":"2026-08-05T13:24:39.653975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-08-16T03:39:21.994462Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-05T13:24:39.659106Z","title":"Video-mmmu: Evaluating knowledge acquisition from multi-discipline professional videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.659106Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:ae07c2e20979135d581e7c66646a5871449067ed8770d834df055cb414c8a2a2","observation_id":"bac3de43-4733-4cfc-8917-fae8087cf7ea","resolution":{"observed_at":"2026-08-05T13:24:39.659106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-16T02:03:48.252223Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-05T13:24:39.670700Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.670700Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:b6a77e98faa7a240f5cb8fe42f0de3ff34c8ace14be971f88d6cde640e4e6410","observation_id":"b349b044-87c8-4a74-8c06-fc34d9966ed2","resolution":{"observed_at":"2026-08-05T13:24:39.670700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T13:24:39.675483Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.675483Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:1ce17e2780c4e574070243910cab74015f9420a010430f378cdf612f3d82d92f","observation_id":"a538029e-3803-4a07-aa4f-de78abda9025","resolution":{"observed_at":"2026-08-05T13:24:39.675483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.680307Z","title":"A diagram is worth a dozen images, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.680307Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:3e6c1031c64a987a0fea7ac9fcfeda5c33a3004ff031bbec1241bd3271bb5a45","observation_id":"b9ced648-191f-4b70-8392-a741a2529c46","resolution":{"observed_at":"2026-08-05T13:24:39.680307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.685138Z","title":"Process reward models that think","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.685138Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:bd721c8f354f56605a4deb22ee3539b8f1fcf8b188cc6ec89c975255b45ce8f6","observation_id":"ef2a548f-1c98-4a1a-830e-a71a6d157ba2","resolution":{"observed_at":"2026-08-05T13:24:39.685138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T13:24:39.690648Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.690648Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:60946379f5b06de92e66db92d100c21a5c8f6ca5638ded965f3e93edc9b828d7","observation_id":"178119a2-420c-43e2-891c-510f2a3b9fbc","resolution":{"observed_at":"2026-08-05T13:24:39.690648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17451","last_updated":"2025-06-02T05:46:18Z","snapshot_observed_at":"2026-08-17T03:27:30.826224Z","submitted_at":"2024-11-26T14:08:34Z","title":"VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17451","snapshot_observed_at":"2026-08-05T13:24:39.696801Z","title":"Vl-rewardbench: A challenging benchmark for vision-language generative reward models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.696801Z"},"links":{"cited_paper":"/paper/2411.17451","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:6be561e060090e2ac28698713a68ebc276476a6f1af8b40d0af734e6a481b039","observation_id":"de18d49c-57ed-402f-a32f-3de92e04252b","resolution":{"observed_at":"2026-08-05T13:24:39.696801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-05T13:24:39.701994Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.701994Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:01e15951c8e73b78c81608eafec858e1ff4519f719333dd0d53c3201c2df1c13","observation_id":"4c40fdb1-95b6-49e4-821c-730d39f4ef74","resolution":{"observed_at":"2026-08-05T13:24:39.701994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.706968Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.706968Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:06ed7126139d696ec1fbacb4b2d71a36515ac827df7c404f28c6cae8f83e71a3","observation_id":"57fd7618-4392-4cec-957b-96f152aab42e","resolution":{"observed_at":"2026-08-05T13:24:39.706968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.711719Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.711719Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:2663a5730ff86008ef127e8574dd8de505a57ec07c12822a739e655e08fbc40c","observation_id":"3305b9b3-48f4-453e-aaee-f65503ffafa2","resolution":{"observed_at":"2026-08-05T13:24:39.711719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.716806Z","title":"Noisyrollout: Reinforcing visual reasoning with data augmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.716806Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:bc985948e8e080d6ec734da8b8f391bd03750b6ccbe332fb9b0fc79ea173f1be","observation_id":"3e770e54-9690-40ea-86c1-9bb263ec143a","resolution":{"observed_at":"2026-08-05T13:24:39.716806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:41.316514Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216--233","venue":null,"work_id":"2bd28eae-844d-4794-afd4-0547fee70e3f","year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.722147Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:19644f206544c37e76be8e3cef3b7dc9138a2fced71abc18449f0dec2a3aec11","observation_id":"07490fcf-1e7d-491e-92c7-5752b4acaefe","resolution":{"observed_at":"2026-08-05T13:24:41.322013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:41.298888Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models","venue":null,"work_id":"24271082-f168-446d-b2c9-22014ce05d4e","year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.727020Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:c1c040e86a812d1bf5be66b66bcf4b4acb7fbe98e1641a8aad4c5c769e4b0326","observation_id":"31857890-368e-45ca-9821-07fb765e8b8a","resolution":{"observed_at":"2026-08-05T13:24:41.304994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.732122Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.732122Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:ddfe545bc5b23c509884fd9fc9b7b0a852bbfffb0d9f06f7c036bff137da7309","observation_id":"723e0e19-0b3c-4c7d-80a3-904aee3178e1","resolution":{"observed_at":"2026-08-05T13:24:39.732122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12832","last_updated":"2024-10-02T17:58:39Z","snapshot_observed_at":"2026-08-16T13:13:15.134731Z","submitted_at":"2024-10-02T17:58:39Z","title":"Generative Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12832","snapshot_observed_at":"2026-08-05T13:24:39.737223Z","title":"Generative reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.737223Z"},"links":{"cited_paper":"/paper/2410.12832","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:9a93e99789e6c10648b2077cbed12784127203f400aa05d392c3132834dab8f5","observation_id":"74715f75-17e2-4199-8624-cfb7477650ad","resolution":{"observed_at":"2026-08-05T13:24:39.737223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-05T13:24:39.742920Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.742920Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:a6ff0194627a96adcd83e0976486ada344bef94d6d6b40149b1659f14aa41b12","observation_id":"5a250e68-03df-442c-92d8-f8ca24badbbf","resolution":{"observed_at":"2026-08-05T13:24:39.742920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-13T20:16:31.803514Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-05T13:24:39.747881Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.747881Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:e61875d347c6cdf018fe01013557c0c193bf395d69a41075c9bd3723137cb50f","observation_id":"c55f1b8a-1eaa-499e-9d5f-ff3c7c2de962","resolution":{"observed_at":"2026-08-05T13:24:39.747881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:41.272169Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":"f374fe9c-66a7-4961-88ee-c4ed4e346273","year":2023},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.753145Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:811be7f4d91788884f2d5ac7921c88d8fa08740a52301222386a44588ddfb1cc","observation_id":"34765e4b-2911-4aa3-8025-95466ac147c8","resolution":{"observed_at":"2026-08-05T13:24:41.277440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:41.255898Z","title":"Learning to reason with llms, 2024","venue":null,"work_id":"7c41976d-f8dc-4f9a-b425-6ba2633db67f","year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.758088Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:d881456c094972853e07ca5cbd888797955444699b9e53005a3d50d7f6062264","observation_id":"51c071c5-8514-4663-b398-99f275f20ad1","resolution":{"observed_at":"2026-08-05T13:24:41.260915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.763610Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.763610Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:b4ad79e85acb238d6ddf4094495d95098c8ba2c18a2134a73962b2b7d814b405","observation_id":"3fcc1a58-bc25-43b9-bb6a-09da4fb64832","resolution":{"observed_at":"2026-08-05T13:24:39.763610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-08-18T16:51:32.000170Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-05T13:24:39.768630Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.768630Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:e581dc3d92e1bf54a04a5f26b1afedb9a485e16bfbd31d1dd5dc82d61cde6491","observation_id":"946504b3-bcbd-45dc-8439-217a274ad464","resolution":{"observed_at":"2026-08-05T13:24:39.768630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08048","last_updated":"2024-10-10T15:43:55Z","snapshot_observed_at":"2026-08-16T13:10:38.841786Z","submitted_at":"2024-10-10T15:43:55Z","title":"VerifierQ: Enhancing LLM Test Time Compute with Q-Learning-based Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08048","snapshot_observed_at":"2026-08-05T13:24:39.774604Z","title":"Verifierq: Enhancing llm test time compute with q-learning-based verifiers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.774604Z"},"links":{"cited_paper":"/paper/2410.08048","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:95424d42ffbda711ed235acb36528f272118c0edce82eb349f8137ab377ff266","observation_id":"c9be0652-2f35-4f3a-9ca3-c9eccf814e1a","resolution":{"observed_at":"2026-08-05T13:24:39.774604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:41.227063Z","title":"Vision language models are blind","venue":null,"work_id":"276c6378-cd70-474f-9dc1-ad9fe0811f6b","year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.779624Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:ca1fda95d5ec3a8af7010183e5afad3fa33cf370df696146fafbb2ca7415df21","observation_id":"7dcf6623-c1af-4cbf-9a42-11066e888fad","resolution":{"observed_at":"2026-08-05T13:24:41.232261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-08-05T13:24:39.784349Z","title":"Atkinson, Aaditya Baranwal, Alexandru Coca, Mikah Dang, Sebastian Dziadzio, Jakob D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.784349Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:48ad3c4668ae2ab10b46de9fab7832d3983581e293743e0a45013b0d3cfe7d97","observation_id":"9bc0b383-70dc-41d8-b6f7-78728df2e511","resolution":{"observed_at":"2026-08-05T13:24:39.784349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T13:24:39.789396Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.789396Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:e14b0f3b22c87eb9e75f0f1f593b0ad50b6e419014310eda35373b6301fb4b84","observation_id":"2b0c2e3f-79b5-4094-bab6-81b11772e5cc","resolution":{"observed_at":"2026-08-05T13:24:39.789396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T13:24:39.794093Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.794093Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:ba20a4d94ac445d23857da0bf3c087b8a6dc93d53b789fe64a99a007eafc21ed","observation_id":"92d408ac-a580-4b8e-afc5-0296b78e67ed","resolution":{"observed_at":"2026-08-05T13:24:39.794093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-08-15T23:42:34.277075Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-05T13:24:39.799101Z","title":"Aligning large multimodal models with factually augmented rlhf, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.799101Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:04d9c732253a0a9861f5d803521f306225aa1e52d9909ccd12b5c800b734507e","observation_id":"43047e17-8353-43d1-9bfd-bdee1207effc","resolution":{"observed_at":"2026-08-05T13:24:39.799101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-19T14:19:04.114322Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-05T13:24:39.805838Z","title":"Mimo-vl technical report, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.805838Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:74448c11278735ae431528d70666e395a787a99b4a7fc581bd142ba3c4cfddde","observation_id":"1283b163-a25e-4989-99da-ea011bde4706","resolution":{"observed_at":"2026-08-05T13:24:39.805838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-08-05T13:24:39.812161Z","title":"Glm-4.1v-thinking: Towards versatile multimodal reasoning with scalable reinforcement learning, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.812161Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:0fb131b74b1e81265f4989114426cf3ad8d119c13d4f1fa57a4c294550fed989","observation_id":"879f3a98-fe4c-4a9a-8316-1e03eaad7e5a","resolution":{"observed_at":"2026-08-05T13:24:39.812161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06209","last_updated":"2024-04-25T07:12:39Z","snapshot_observed_at":"2026-08-16T14:28:07.420590Z","submitted_at":"2024-01-11T18:58:36Z","title":"Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06209","snapshot_observed_at":"2026-08-05T13:24:39.817974Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.817974Z"},"links":{"cited_paper":"/paper/2401.06209","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:c379c05dcea59a570d6ac6fb4f61607c61e930ed730c9def64284e0daa448db3","observation_id":"fa75da25-bfe4-4e13-822e-b46c35599431","resolution":{"observed_at":"2026-08-05T13:24:39.817974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.823412Z","title":"Srpo: Enhancing multimodal llm reasoning via reflection-aware reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.823412Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:e6cab832c617fbe5814251918ddbbaefb3e06fe3e03142f1918ab13ea449c82f","observation_id":"6164018c-232a-4b4c-9561-770c7be1db9c","resolution":{"observed_at":"2026-08-05T13:24:39.823412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-08-17T11:15:45.055944Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-05T13:24:39.829566Z","title":"Vl-rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.829566Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:e3e2bcc6d1606a0ca174fc4d673a8605da94f6ac77f7d92861405a26aaf50f5c","observation_id":"0805543d-08da-4fe1-8fcf-2341a6090190","resolution":{"observed_at":"2026-08-05T13:24:39.829566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:41.209500Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":"7b4dd763-5031-4ab9-8c6d-8cc30ce99d92","year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.835197Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:b70cd452aefa9c8d10ab7643e6d8bc8f56bf8c661509dacd9104c7240a4fa987","observation_id":"7370178e-d63b-4e1e-a69d-d9e8cceec03c","resolution":{"observed_at":"2026-08-05T13:24:41.215347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10291","last_updated":"2025-03-13T12:03:37Z","snapshot_observed_at":"2026-08-18T20:18:33.442413Z","submitted_at":"2025-03-13T12:03:37Z","title":"VisualPRM: An Effective Process Reward Model for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10291","snapshot_observed_at":"2026-08-05T13:24:39.845687Z","title":"Visualprm: An effective process reward model for multimodal reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.845687Z"},"links":{"cited_paper":"/paper/2503.10291","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:a83b19284a9fce16268ef82d5d85c105d89670572374f8570f72625150b3de31","observation_id":"5e30e8a2-f9a7-480f-ac96-142f40427ac7","resolution":{"observed_at":"2026-08-05T13:24:39.845687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15973","last_updated":"2025-02-08T21:50:41Z","snapshot_observed_at":"2026-08-16T13:49:35.405713Z","submitted_at":"2024-05-24T23:09:27Z","title":"Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15973","snapshot_observed_at":"2026-08-05T13:24:39.852228Z","title":"Enhancing visual-language modality alignment in large vision language models via self-improvement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.852228Z"},"links":{"cited_paper":"/paper/2405.15973","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:02c3245901ee652a17cf036792d29416190a4044de706c904b11da059ae1a205","observation_id":"05e5b6d7-ed0c-4f79-b7bb-65ec5234e508","resolution":{"observed_at":"2026-08-05T13:24:39.852228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03704","last_updated":"2025-06-30T20:29:34Z","snapshot_observed_at":"2026-08-14T19:57:03.409333Z","submitted_at":"2024-12-04T20:35:07Z","title":"Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension","version":3},"cited_work":{"arxiv_id":"2412.03704","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03704","snapshot_observed_at":"2026-08-05T13:24:40.386203Z","title":"Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension","venue":"cs.CV","work_id":"c1f8f2e3-f159-4193-b5f9-d1ce0694c852","year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.858355Z"},"links":{"cited_paper":"/paper/2412.03704","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:62580b15d6bb3400a53f6b8b4e8f97608514a0eb707007324ccc92496d41814e","observation_id":"e74bdea1-5859-4b61-a8b2-633f4646b1b9","resolution":{"observed_at":"2026-08-05T13:24:40.393917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10128","snapshot_observed_at":"2026-08-05T13:24:39.864757Z","title":"Vicrit: A verifiable reinforcement learning proxy task for visual perception in vlms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.864757Z"},"links":{"cited_paper":"/paper/2506.10128","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:408967954c79f9824e132670257f68700a7c477358418a294be4925f7047c8ce","observation_id":"9baea096-df66-4209-84a4-cc84c740d227","resolution":{"observed_at":"2026-08-05T13:24:39.864757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07934","last_updated":"2025-05-30T15:53:16Z","snapshot_observed_at":"2026-08-18T15:38:17.639385Z","submitted_at":"2025-04-10T17:49:05Z","title":"SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07934","snapshot_observed_at":"2026-08-05T13:24:39.870088Z","title":"Sota with less: Mcts-guided sample selection for data-efficient visual reasoning self-improvement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.870088Z"},"links":{"cited_paper":"/paper/2504.07934","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:be02428586c59da85de9696a44f9e14272734724a2431a2bf6629a147d850f24","observation_id":"47e2937b-eda5-4503-9d59-4ba53a5bd6b7","resolution":{"observed_at":"2026-08-05T13:24:39.870088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.875987Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.875987Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:45b327347fd7b9121a0ae0ca0021a4dbdc016973452081cbb186d9519c715f1f","observation_id":"3674e452-b019-4857-80a8-1c47202b94e9","resolution":{"observed_at":"2026-08-05T13:24:39.875987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.880646Z","title":"Open vision reasoner: Transferring linguistic cognitive behavior for visual reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.880646Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:310edbfc65784b56cb430777961bbc8ef0d185735fd67b2ab615ecd15d966ae3","observation_id":"5ad221a9-477a-4640-93cf-f9ec647b244d","resolution":{"observed_at":"2026-08-05T13:24:39.880646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-19T21:13:51.714507Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T13:24:39.885634Z","title":"V*: Guided visual search as a core mechanism in multimodal llms, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.885634Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:2926e1296fb945c5f5ad3b00e71c016297052b60d5d91e1e21d39e036463a29a","observation_id":"e3c446d9-6703-4203-825c-4baea7897aba","resolution":{"observed_at":"2026-08-05T13:24:39.885634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-13T03:06:10.986532Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-05T13:24:39.892735Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.892735Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:40f1108d42ae6ac428b236cad9b862c35d096f0183a0fbf7bcb0e361fd59198c","observation_id":"768a6749-4d68-45da-9c1c-064e1b3fc2f9","resolution":{"observed_at":"2026-08-05T13:24:39.892735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00451","last_updated":"2024-06-17T22:11:49Z","snapshot_observed_at":"2026-08-18T09:48:11.842015Z","submitted_at":"2024-05-01T11:10:24Z","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00451","snapshot_observed_at":"2026-08-05T13:24:39.898650Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.898650Z"},"links":{"cited_paper":"/paper/2405.00451","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:5a08dccece6c1daa136278c6754315335d7035bc9b0a8a94614d9339742e9f14","observation_id":"3ed8bf8c-fce5-4454-a622-c5bef9720374","resolution":{"observed_at":"2026-08-05T13:24:39.898650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02712","last_updated":"2025-03-04T00:49:07Z","snapshot_observed_at":"2026-08-16T13:12:52.288371Z","submitted_at":"2024-10-03T17:36:33Z","title":"LLaVA-Critic: Learning to Evaluate Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02712","snapshot_observed_at":"2026-08-05T13:24:39.903930Z","title":"Llava-critic: Learning to evaluate multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.903930Z"},"links":{"cited_paper":"/paper/2410.02712","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:3db9e8e33aac1f369ec33344180b21f2de3c0ee277a02dfecf0b0cd8edcb1494","observation_id":"d55eb9da-3eb0-4479-8494-2aca89b2e0a5","resolution":{"observed_at":"2026-08-05T13:24:39.903930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:41.178079Z","title":"Llava-critic: Learning to evaluate multimodal models","venue":null,"work_id":"d2a26ef3-73d2-4b74-87f8-b383fe5e9641","year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.910004Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:d6cc458b2cc045e22f912c23c6d7f02709f78113e51e20bdca2d4a8d4b7749ca","observation_id":"7f57d251-a640-4578-b521-e592117281b3","resolution":{"observed_at":"2026-08-05T13:24:41.183495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15279","last_updated":"2025-04-21T17:59:53Z","snapshot_observed_at":"2026-08-18T11:09:01.459046Z","submitted_at":"2025-04-21T17:59:53Z","title":"VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15279","snapshot_observed_at":"2026-08-05T13:24:39.914942Z","title":"Visulogic: A benchmark for evaluating visual reasoning in multi-modal large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.914942Z"},"links":{"cited_paper":"/paper/2504.15279","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:cede4300d2d4e455970843c838a7408bf4921fd8681cec0ae1ae568afbcda432","observation_id":"b840d0aa-88db-4ee4-8d7c-aea8368770aa","resolution":{"observed_at":"2026-08-05T13:24:39.914942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16673","last_updated":"2025-05-22T13:39:32Z","snapshot_observed_at":"2026-08-19T20:36:07.534727Z","submitted_at":"2025-05-22T13:39:32Z","title":"R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16673","snapshot_observed_at":"2026-08-05T13:24:39.920134Z","title":"R1-sharevl: Incentivizing reasoning capability of multimodal large language models via share-grpo","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.920134Z"},"links":{"cited_paper":"/paper/2505.16673","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:a44e058ad8217fba28b247873bdbb3a803a6ab3ace7718fe90a3bc39633f1fd4","observation_id":"eb46d933-46d4-4af1-a71d-31fb270055d6","resolution":{"observed_at":"2026-08-05T13:24:39.920134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22607","last_updated":"2025-07-31T09:09:45Z","snapshot_observed_at":"2026-08-13T02:58:31.453226Z","submitted_at":"2025-07-30T12:23:21Z","title":"VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22607","snapshot_observed_at":"2026-08-05T13:24:39.926180Z","title":"Vl-cogito: Progressive curriculum reinforcement learning for advanced multimodal reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.926180Z"},"links":{"cited_paper":"/paper/2507.22607","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:eea26639d22287ff89e3d1fea08790bffa7dbc9f4044d7e43f6f378be04181dd","observation_id":"9c80213e-e434-4764-b9a1-dd9b0fe19e70","resolution":{"observed_at":"2026-08-05T13:24:39.926180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.931710Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.931710Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:339db7085d850d7d72086d7c3fe2d6e5ca1d1b231b0d4008fac71f7bd5a5db4d","observation_id":"aea25225-aca4-4e11-a217-6a2b89ddfc92","resolution":{"observed_at":"2026-08-05T13:24:39.931710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-17T21:21:26.500724Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-08-05T13:24:39.936440Z","title":"Internlm-xcomposer2.5-reward: A simple yet effective multi-modal reward model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.936440Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:fbb8611bb107ced88d9cf543c4874df208d2aeb8e81a87d430c0a0058ef6cbf0","observation_id":"2d5e40fb-ea29-4f77-b6e6-136cf38cf54c","resolution":{"observed_at":"2026-08-05T13:24:39.936440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-08-17T07:45:48.419891Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-05T13:24:39.942045Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.942045Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:b12f936c4a49f60ce7889d8a440e24a25ff60b7e6fdfc19881d43ca56476ea69","observation_id":"3b2b7650-77ba-4a4c-8f8a-f9cdadc85895","resolution":{"observed_at":"2026-08-05T13:24:39.942045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-13T03:52:04.619847Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-05T13:24:39.947616Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? arXiv preprint arXiv:2403.14624, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.947616Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:692d3b07d69b321e24704ef88be75288bf5ed8dd2b707cba9ff490285ba96602","observation_id":"a4ba5982-1ad0-4cc9-a6b8-e41474e70ca2","resolution":{"observed_at":"2026-08-05T13:24:39.947616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-18T20:45:17.486312Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T13:24:39.953253Z","title":"Nemotron-research-tool-n1: Exploring tool-using language models with reinforced reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.953253Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:82f9c13ad9ca53a70d8d468a2f3b69a9e67c4d12a00e2d6d569511579908a400","observation_id":"8d24ae44-7827-42b1-bf90-4ea7efc56487","resolution":{"observed_at":"2026-08-05T13:24:39.953253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-19T11:40:26.978263Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-05T13:24:39.958836Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.958836Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:822ddda943b9f31ed9965089493965759e9e63f444cfdd2d55e5944e18f6224f","observation_id":"c14f5cbe-4c50-4d78-8a14-f4c8a8024c93","resolution":{"observed_at":"2026-08-05T13:24:39.958836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-17T15:53:34.369922Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-05T13:24:39.964837Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment, 2025 c","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.964837Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:aed2ec8bac36354fc908c843b71fd08013c03d31a158fdb2f6d126dd29dad7c6","observation_id":"9d7afc8e-51e1-4898-9593-28a73edb2c14","resolution":{"observed_at":"2026-08-05T13:24:39.964837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00891","last_updated":"2025-04-05T03:04:37Z","snapshot_observed_at":"2026-08-19T12:21:13.450899Z","submitted_at":"2025-04-01T15:21:05Z","title":"GenPRM: Scaling Test-Time Compute of Process Reward Models via Generative Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00891","snapshot_observed_at":"2026-08-05T13:24:39.969937Z","title":"Genprm: Scaling test-time compute of process reward models via generative reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.969937Z"},"links":{"cited_paper":"/paper/2504.00891","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:c53b4264cdf693e4ec0cfa9924c180094182f64e34e869a8e08ab713d375ce33","observation_id":"b17e8c60-dd13-46b4-9bf3-6a46a0cd282b","resolution":{"observed_at":"2026-08-05T13:24:39.969937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:41.149458Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":"d0f8a90c-e490-4a05-a7a2-cec483ff4ce0","year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.975792Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:edf9342f514e80dd07063ff6900188e9b7d0dbcdac9cbfdaf07b29efb476f6c1","observation_id":"30cc9626-792b-4408-b9c4-d300a389e698","resolution":{"observed_at":"2026-08-05T13:24:41.155334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.981501Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.981501Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:e71b21cf3cb7cd0b20e188d9561da98d3b6eeb8bb5d6ea9498f46763f3eeeae5","observation_id":"93c03e7c-9b72-4505-99e9-f8fe3882c242","resolution":{"observed_at":"2026-08-05T13:24:39.981501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 14 inbound Pith citation observations for arXiv:2509.00676."}