{"as_of":"2026-08-12T04:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d609bbe6694b6f9873e3490f155c58d1d2715e06393f9a07aec3abc30680db58","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:48:37.725055Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:35:11.261146Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-06T11:35:11.261146Z","title":"Grpo-care: Consistency-aware reinforcement learning for multimodal reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22607","last_updated":"2025-07-31T09:09:45Z","snapshot_observed_at":"2026-08-09T20:47:50.407542Z","submitted_at":"2025-07-30T12:23:21Z","title":"VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T11:35:11.261146Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2507.22607"},"observation_digest":"sha256:58f1caa27bc79c57f84d7bcafffc5a450dddfe1795a833c207fca36fb7600c98","observation_id":"98c1c08e-f4f6-4914-8582-a873fff20c39","resolution":{"observed_at":"2026-08-06T11:35:11.261146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-05T23:43:03.419373Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05011","last_updated":"2025-08-07T03:49:18Z","snapshot_observed_at":"2026-08-06T05:37:26.433479Z","submitted_at":"2025-08-07T03:49:18Z","title":"Towards Hallucination-Free Music: A Reinforcement Learning Preference Optimization Framework for Reliable Song Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T23:43:03.419373Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2508.05011"},"observation_digest":"sha256:1ca37a0d3ea8a4cf6551b8d0884967a3e6e732c4da27355bb9ec061a1e7916eb","observation_id":"ac8c59c9-589e-4ac1-9487-00d555b75867","resolution":{"observed_at":"2026-08-05T23:43:03.419373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:8d95cfea458769c1879531a04dc1663ddc4238630cb11b17b125eeee7a82c111","observation_id":"ea14883e-98a6-4fb9-9ef4-a8371292709f","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2506.16141","doi":"10.48550/arxiv.2506.16141","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grpo- care: Consistency-aware reinforcement learning for multimodal reasoning","venue":"ArXiv.org","work_id":"41a7dfb7-5564-4132-89bf-b7301ad2fd75","year":2025},"citing_paper":{"arxiv_id":"2605.03485","last_updated":"2026-05-05T08:20:48Z","snapshot_observed_at":"2026-07-06T23:16:25.301792Z","submitted_at":"2026-05-05T08:20:48Z","title":"MHPR: Multidimensional Human Perception and Reasoning Benchmark for Large Vision-Languate Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T01:20:54.441367Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2605.03485"},"observation_digest":"sha256:2b1992c525a22cc1dcc41e1576a71f729e4a7ca25f0320e02bb7cf8686857e11","observation_id":"ba0bfcdd-be2f-4489-b396-47970bb67ef4","resolution":{"observed_at":"2026-05-11T23:11:15.673718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2506.16141","doi":"10.48550/arxiv.2506.16141","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grpo- care: Consistency-aware reinforcement learning for multimodal reasoning","venue":"ArXiv.org","work_id":"41a7dfb7-5564-4132-89bf-b7301ad2fd75","year":2025},"citing_paper":{"arxiv_id":"2605.13641","last_updated":"2026-05-13T15:05:18Z","snapshot_observed_at":"2026-07-06T23:25:11.623026Z","submitted_at":"2026-05-13T15:05:18Z","title":"Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T19:24:05.375951Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2605.13641"},"observation_digest":"sha256:0e789d17c62e0f02364fa2b4d24f05e6cf18c32be65948f4ce7b9ce6a819fd63","observation_id":"e9c14120-8beb-4b12-8b0b-274c4bf4b9d0","resolution":{"observed_at":"2026-05-14T19:27:51.300574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2506.16141","doi":"10.48550/arxiv.2506.16141","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grpo- care: Consistency-aware reinforcement learning for multimodal reasoning","venue":"ArXiv.org","work_id":"41a7dfb7-5564-4132-89bf-b7301ad2fd75","year":2025},"citing_paper":{"arxiv_id":"2605.21801","last_updated":"2026-05-20T22:59:02Z","snapshot_observed_at":"2026-07-31T22:43:35.705855Z","submitted_at":"2026-05-20T22:59:02Z","title":"Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T08:53:02.051453Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2605.21801"},"observation_digest":"sha256:4837c31fe29fa69893c64c03a1365e08a808b9752ddc7c92732653453912f0c4","observation_id":"f3429f25-bb38-4d17-b2ff-70b78648a36c","resolution":{"observed_at":"2026-05-22T08:54:45.752486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2506.16141","doi":"10.48550/arxiv.2506.16141","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grpo- care: Consistency-aware reinforcement learning for multimodal reasoning","venue":"ArXiv.org","work_id":"41a7dfb7-5564-4132-89bf-b7301ad2fd75","year":2025},"citing_paper":{"arxiv_id":"2605.26680","last_updated":"2026-05-26T08:16:16Z","snapshot_observed_at":"2026-07-06T23:36:29.930024Z","submitted_at":"2026-05-26T08:16:16Z","title":"DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T17:50:00.740770Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2605.26680"},"observation_digest":"sha256:f086d8d74ce2571dd04fa81286cda5e87d3eaa15c8db358bf8fe05b2cddb1c8f","observation_id":"9b56a2e3-91fe-42c4-a10f-3c2b1b66a312","resolution":{"observed_at":"2026-06-29T17:53:47.092273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2506.16141","doi":"10.48550/arxiv.2506.16141","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grpo- care: Consistency-aware reinforcement learning for multimodal reasoning","venue":"ArXiv.org","work_id":"41a7dfb7-5564-4132-89bf-b7301ad2fd75","year":2025},"citing_paper":{"arxiv_id":"2605.27154","last_updated":"2026-05-26T15:14:56Z","snapshot_observed_at":"2026-08-10T18:37:50.736930Z","submitted_at":"2026-05-26T15:14:56Z","title":"Touch-R1: Reinforcing Touch Reasoning in MLLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T18:55:05.919049Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2605.27154"},"observation_digest":"sha256:f9db50c80da2c12d9d58922fe272a47707a4dca695b5719f0fecd3800ec39bc7","observation_id":"14e8d7db-96f7-45bf-99ff-3b55098fb9db","resolution":{"observed_at":"2026-06-29T19:03:51.639487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2506.16141","doi":"10.48550/arxiv.2506.16141","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grpo- care: Consistency-aware reinforcement learning for multimodal reasoning","venue":"ArXiv.org","work_id":"41a7dfb7-5564-4132-89bf-b7301ad2fd75","year":2025},"citing_paper":{"arxiv_id":"2606.02564","last_updated":"2026-06-27T07:03:15Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:54:26Z","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T15:26:21.284810Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2606.02564"},"observation_digest":"sha256:f8b863f9833e30fbbfc56f6d55fa8a1f57efa221f5512674145ebe89487dbd59","observation_id":"7dbb6506-44d7-4151-a07d-775cf052e55e","resolution":{"observed_at":"2026-07-01T22:26:17.320768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2506.16141","doi":"10.48550/arxiv.2506.16141","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grpo- care: Consistency-aware reinforcement learning for multimodal reasoning","venue":"ArXiv.org","work_id":"41a7dfb7-5564-4132-89bf-b7301ad2fd75","year":2025},"citing_paper":{"arxiv_id":"2606.02564","last_updated":"2026-06-27T07:03:15Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:54:26Z","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-30T10:38:22.619277Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2606.02564"},"observation_digest":"sha256:b10f12c3d84a4030c628f8e1d88eac824d15f0d8f9f3ca8f3a2416865029fcd1","observation_id":"1ef5e2ec-7c53-4b66-8092-847994b7ba01","resolution":{"observed_at":"2026-06-30T10:44:36.816892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2506.16141","doi":"10.48550/arxiv.2506.16141","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grpo- care: Consistency-aware reinforcement learning for multimodal reasoning","venue":"ArXiv.org","work_id":"41a7dfb7-5564-4132-89bf-b7301ad2fd75","year":2025},"citing_paper":{"arxiv_id":"2606.18988","last_updated":"2026-06-17T12:08:20Z","snapshot_observed_at":"2026-08-06T08:59:20.055779Z","submitted_at":"2026-06-17T12:08:20Z","title":"ThinkDeception: A Progressive Reinforcement Learning Framework for Interpretable Multimodal Deception Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T20:58:30.855338Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2606.18988"},"observation_digest":"sha256:a609b5cf6b05898814f23a1dde8a1e051caae6c81767a0125420270ff03f92d9","observation_id":"d4b025b0-8a22-45d5-aae7-e2db5fb881f0","resolution":{"observed_at":"2026-07-04T00:49:18.252360Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2506.16141","doi":"10.48550/arxiv.2506.16141","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grpo- care: Consistency-aware reinforcement learning for multimodal reasoning","venue":"ArXiv.org","work_id":"41a7dfb7-5564-4132-89bf-b7301ad2fd75","year":2025},"citing_paper":{"arxiv_id":"2606.30217","last_updated":"2026-06-29T12:30:24Z","snapshot_observed_at":"2026-08-03T23:12:01.383471Z","submitted_at":"2026-06-29T12:30:24Z","title":"Before Thinking, Learn to Decide: Proactive Routing for Efficient Visual Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T05:55:19.083517Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2606.30217"},"observation_digest":"sha256:10050673cb4d5f2e0d3599173ba87127349c749c8c4219437526c823a5304276","observation_id":"d83f06a3-2c79-4a41-b0bd-fc3c6771115c","resolution":{"observed_at":"2026-06-30T13:34:41.169558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-07-14T14:00:00.388339Z","title":"arXiv preprint arXiv:2506.16141 (2025) 2, 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10147","last_updated":"2026-07-11T06:15:03Z","snapshot_observed_at":"2026-08-07T02:35:47.571845Z","submitted_at":"2026-07-11T06:15:03Z","title":"REVA-PO: Stabilizing Reinforcement Learning for Chest X-ray Report Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T14:00:00.388339Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2607.10147"},"observation_digest":"sha256:d5b8ef9b2e4b71681b6ca3728040323ea53d59b2d6e042417c5178fe3a27f374","observation_id":"ad9f6d09-1dc7-4dd0-9c3c-8b7df3220910","resolution":{"observed_at":"2026-07-14T14:00:00.388339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.16141/citation-record","integrity":"/paper/2506.16141/integrity","json":"/paper/2506.16141/citation-record.json","paper":"/paper/2506.16141"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:48:32.974881Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:32.974881Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:f10b6c82457cb08f50bbf03ea69585ca6d1dde5fe666a59e7756c9ae6eb92a4b","observation_id":"1f1d5302-beb0-423c-96f4-79e6943e7596","resolution":{"observed_at":"2026-08-06T23:48:32.974881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:41.031431Z","title":null,"venue":null,"work_id":"62f2db28-ada0-495e-8db3-3a54647f2cf7","year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.018546Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:ae4a09cf9f532c097ee1dd07f0c9d26ec3346112295c63207b41eb30f701fe9b","observation_id":"24167e82-b909-4652-9040-1d7369cbefcb","resolution":{"observed_at":"2026-08-06T23:48:41.128978Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T23:48:33.083995Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.083995Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:a97ca84d4ce6616f3295eba5836787a5dd0001662dd171edddeb7b8c371e4b73","observation_id":"96bc01f3-3303-4e46-94cd-badd1d66a95a","resolution":{"observed_at":"2026-08-06T23:48:33.083995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T23:48:33.164335Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.164335Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:edffbb78cbf33f945ffc6a203d59f546e28231d5b23624f954f2c63008f230c4","observation_id":"07a8d6fe-123a-4013-9744-9ef7209e42e7","resolution":{"observed_at":"2026-08-06T23:48:33.164335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:33.223889Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.223889Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:32669c514a9dfacdbf70d1ff8734f160e95a3f377ad5e87297721fad83c78341","observation_id":"7aedcf7f-19ce-4c21-afc1-14879ba2e61c","resolution":{"observed_at":"2026-08-06T23:48:33.223889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-06T23:48:33.343894Z","title":"Demystifying long chain-of-thought reasoning in llms.arXiv preprint arXiv:2502.03373, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.343894Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:2e94416c0482ff38f7cf30cffb69f268a32e3dd8faca88cfb9755629b567f75b","observation_id":"87668594-5f01-4f8b-87d3-d9f12a73318e","resolution":{"observed_at":"2026-08-06T23:48:33.343894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-06T23:48:33.451030Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization.arXiv preprint arXiv:2503.12937, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.451030Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:6783a8eae14a4f87d1330613c3ccc149001282e393dab71e5d6e7c5e1617bd58","observation_id":"7ba8fcbb-2e6b-49cc-a7f8-6b01284932df","resolution":{"observed_at":"2026-08-06T23:48:33.451030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-06T23:48:33.585809Z","title":"Visual-rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.585809Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:421f9f8fb953e369d9a1d7f53f6a5f2408f2e2572701a7c6b6e335f5025a7258","observation_id":"f1dcbb12-835c-47db-b815-97acdf0acfd0","resolution":{"observed_at":"2026-08-06T23:48:33.585809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-06T23:48:33.702470Z","title":"Mm-eureka: Exploring visual aha moment with rule-based large-scale reinforcement learning.arXiv preprint arXiv:2503.07365, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.702470Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:ee32cea3981abc41eec81c9fb30d1d163579052d260e2b1c7ed5b24958ed6b95","observation_id":"4d460403-1db4-4434-a36a-5a883226b3fc","resolution":{"observed_at":"2026-08-06T23:48:33.702470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-06T23:48:33.790717Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.790717Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:604f533162381da75d2cd5ba107d228de00226995d36d0f3351f49e4dec10e27","observation_id":"01639783-15c5-441b-99d6-50825f3a2196","resolution":{"observed_at":"2026-08-06T23:48:33.790717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:40.743950Z","title":"Video-r1: Reinforcing video reasoning in mllms, 2025","venue":null,"work_id":"aac97677-7fb9-4a8b-9eef-8f207d86ff72","year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.849002Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:748dff870c74551a9c517d1838efb531f332b89f458c4dbf9932825aceea6d57","observation_id":"3e860905-a7be-4343-940b-cca4e68e3f50","resolution":{"observed_at":"2026-08-06T23:48:40.869684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06722","last_updated":"2024-06-11T06:53:44Z","snapshot_observed_at":"2026-08-09T01:06:11.036691Z","submitted_at":"2023-12-11T03:35:58Z","title":"EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06722","snapshot_observed_at":"2026-08-06T23:48:33.921347Z","title":"Egoplan-bench: Benchmarking multimodal large language models for human-level planning.arXiv preprint arXiv:2312.06722, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.921347Z"},"links":{"cited_paper":"/paper/2312.06722","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:97544f2ca4ad28289b9845f7bebf2fd7f50d2a363a58015d34877d4cecf6c6a5","observation_id":"1b678cb0-2ede-464c-a21e-6c7e4010fef8","resolution":{"observed_at":"2026-08-06T23:48:33.921347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04447","last_updated":"2025-04-11T07:10:02Z","snapshot_observed_at":"2026-08-11T21:21:37.523085Z","submitted_at":"2024-12-05T18:57:23Z","title":"EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04447","snapshot_observed_at":"2026-08-06T23:48:33.993024Z","title":"Egoplan-bench2: A benchmark for multimodal large language model planning in real-world scenarios.arXiv preprint arXiv:2412.04447, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.993024Z"},"links":{"cited_paper":"/paper/2412.04447","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:6418cc90a5919ce9bda356478d81dceb9cf7c5767d12716ed2f4113b44d26d25","observation_id":"fed62ce0-a034-485a-bf36-63085f2fbbd6","resolution":{"observed_at":"2026-08-06T23:48:33.993024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:40.554461Z","title":"Rescaling egocentric vision: Collection, pipeline and challenges for epic-kitchens-100","venue":null,"work_id":"49e0dc71-7d79-403f-bda3-25fc0e9f8690","year":2022},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.042645Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:80a940ece1166f5e4da82c198b0e876572ca5c1a0fb13fb952f7a61771e9e909","observation_id":"caef7470-ac90-4e9c-8f9c-ee95ebbe62f4","resolution":{"observed_at":"2026-08-06T23:48:40.652360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:34.135877Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.135877Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:afe6c5c796e1440791ec462bb4a83981d722fb95f135dbed94f2aec351830194","observation_id":"5ff65fe0-73c8-4310-8e5b-87392040dbc7","resolution":{"observed_at":"2026-08-06T23:48:34.135877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:40.294811Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":"39c927c9-e8f5-482b-bef7-f8f0840c8a32","year":2017},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.212172Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:20bf227d75bb0c1b290aa323e304308721fc8e37844e1191ba8d8b74d0b5346d","observation_id":"f9c40393-dab8-4541-82f8-5cca8d1246b1","resolution":{"observed_at":"2026-08-06T23:48:40.372247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:34.320914Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.320914Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:45c18ad7efe27486ba34dcbc810217cfbe31b7594ba1042e79ccc7d2caa8e2dc","observation_id":"ba36716a-bc1f-4057-bbe6-55210a24beae","resolution":{"observed_at":"2026-08-06T23:48:34.320914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-12T02:21:51.598634Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T23:48:34.438236Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.438236Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:c22da755bce1631587a208da4e73245a0318a7cca17f74078a5e7c29e55e2d16","observation_id":"e55eb96e-5451-4977-8298-c7ca82c2048c","resolution":{"observed_at":"2026-08-06T23:48:34.438236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:34.522538Z","title":"Let’s verify step by step, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.522538Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:59c22c6f925ffa102444388c4f7a98633a90f07ae8b5926dd2d529bfabe2455e","observation_id":"55dc7406-8b3a-440b-b8c9-44bd12456a59","resolution":{"observed_at":"2026-08-06T23:48:34.522538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-06T23:48:34.603403Z","title":"Solving math word problems with process-and outcome-based feedback.arXiv preprint arXiv:2211.14275, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.603403Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:463318809478888145460e6876ae605126cce24bbf6571f04be55ebfd59846f4","observation_id":"0924cf59-4514-4f59-8d31-deddba17e0f4","resolution":{"observed_at":"2026-08-06T23:48:34.603403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:40.053035Z","title":"Alphamath almost zero: Process supervision without process","venue":null,"work_id":"ed44a5a7-64b0-473e-a701-af17355a638a","year":null},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.660272Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:1b35bc8c836c49937756fc5295beacd41023caa1cb614fb1e2d9f06d1a338a9b","observation_id":"703c21e7-fa80-4e50-8baa-1a99f975d6ab","resolution":{"observed_at":"2026-08-06T23:48:40.165451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-06T23:48:34.742575Z","title":"Improve mathematical reasoning in language models by automated process supervision.arXiv preprint arXiv:2406.06592, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.742575Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:15707d68034e5475fd2de6ca4b40f01add24e5063b36237319a49bc716580c39","observation_id":"210ad232-6d95-4711-a1dd-85c5fe2758f7","resolution":{"observed_at":"2026-08-06T23:48:34.742575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-11T06:00:55.192366Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-06T23:48:34.838198Z","title":"Math-shepherd: A label-free step-by-step verifier for llms in mathematical reasoning.arXiv preprint arXiv:2312.08935, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.838198Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:f14f4749501865af6fa3d058431221efcbdbcfa2a8bce84a5b1d7e14e2f0b29c","observation_id":"0feb8827-418f-418e-8da2-a7028c875bb9","resolution":{"observed_at":"2026-08-06T23:48:34.838198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14024","last_updated":"2024-10-18T06:59:24Z","snapshot_observed_at":"2026-08-10T07:28:10.183660Z","submitted_at":"2024-06-20T06:42:27Z","title":"LLM Critics Help Catch Bugs in Mathematics: Towards a Better Mathematical Verifier with Natural Language Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14024","snapshot_observed_at":"2026-08-06T23:48:34.894129Z","title":"Llm critics help catch bugs in mathematics: Towards a better mathematical verifier with natural language feedback.arXiv preprint arXiv:2406.14024, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.894129Z"},"links":{"cited_paper":"/paper/2406.14024","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:63f348673f955fbc752c1d39d1d285e37230a31cbd7a415a50046722694bacc7","observation_id":"3e166373-3cab-4d7d-93c9-1559829a576c","resolution":{"observed_at":"2026-08-06T23:48:34.894129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:39.865522Z","title":"Evaluating mathematical reasoning beyond accuracy","venue":null,"work_id":"69f51e75-a7b6-4057-b3d9-1f144bbdf9d5","year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.955288Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:00f589d3bec96a96979bb8dfe9f56a111637ed43c77bf8ae88a462e904874e75","observation_id":"4249718d-264d-47b1-9722-2ef4abd5d1ae","resolution":{"observed_at":"2026-08-06T23:48:39.929136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-08-10T18:32:18.501904Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-06T23:48:35.066396Z","title":"Generative verifiers: Reward modeling as next-token prediction.arXiv preprint arXiv:2408.15240, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:35.066396Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:a405be6ff835b701206318096af83de098da4107fa348773137894785fe40f51","observation_id":"97e55492-936f-4c0e-a906-accf45d41bb2","resolution":{"observed_at":"2026-08-06T23:48:35.066396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:39.565271Z","title":"Warp: On the benefits of weight averaged rewarded policies, 2024","venue":null,"work_id":"513e3b97-e06b-4ee5-be47-e4ddbbd394f1","year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:35.168865Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:a663898098e9f27b9fdcb092e8df419ba9704f2b1536d9e79df93431c7d13fff","observation_id":"82a53331-fc24-45c0-93c9-e2aad67d13f5","resolution":{"observed_at":"2026-08-06T23:48:39.715436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:35.276903Z","title":"Gtr: Guided thought reinforcement prevents thought collapse in rl-based vlm agent training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:35.276903Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:d4b19cd892b208179890dbd90a3de9f05b59ad6b20db57ef8d04fc33133e5704","observation_id":"3a7d7d8c-b443-443e-a03b-13792fd8bef1","resolution":{"observed_at":"2026-08-06T23:48:35.276903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:39.333605Z","title":"Mm-math: Advancing multimodal math evaluation with process evaluation and fine-grained classification","venue":null,"work_id":"8e44fee7-4802-42e9-b1ca-b6708c8523b1","year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:35.459609Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:734413c8e0ddb5e7b9f097c92d69f40bca244c4a0edcec8bf90f4bb4b8502e33","observation_id":"c747885d-dd23-4ad6-9ada-f9fdd4f839b3","resolution":{"observed_at":"2026-08-06T23:48:39.435084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:39.141030Z","title":"Open-r1-video","venue":null,"work_id":"92107a28-f11a-4bf9-8f3c-02a845455d5b","year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:35.524033Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:56ab90906a01930b1f018332dbcc631162c5760aaefc35d5e3a1e5f9cfd3eaf9","observation_id":"5527d3f9-a4c7-4a69-9141-87eaf4ece1dc","resolution":{"observed_at":"2026-08-06T23:48:39.241098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05379","last_updated":"2025-03-10T07:11:14Z","snapshot_observed_at":"2026-08-07T21:57:26.595540Z","submitted_at":"2025-03-07T12:46:42Z","title":"R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05379","snapshot_observed_at":"2026-08-06T23:48:35.612776Z","title":"R1-omni: Explainable omni-multimodal emotion recognition with reinforcing learning.arXiv preprint arXiv:2503.05379, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:35.612776Z"},"links":{"cited_paper":"/paper/2503.05379","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:06e4c179d1f8ec207e7a2bac0e5adb962a393f177c2994af40dcc2f439606899","observation_id":"f4b54ff6-e282-4069-af2e-5c4dee1f3d62","resolution":{"observed_at":"2026-08-06T23:48:35.612776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:38.918087Z","title":"Mafw: A large-scale, multi-modal, compound affective database for dynamic facial expression recognition in the wild","venue":null,"work_id":"d20eae35-e49b-4a4e-9dc5-7854798fd3fd","year":2022},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:35.679709Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:7c73bf6b45793d74e287c9f94ac05b4ac00e79bda2f75790d122e02d1f2069ce","observation_id":"4042c7ab-253b-407c-887f-31b9ae9694a2","resolution":{"observed_at":"2026-08-06T23:48:39.023697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:38.733969Z","title":"Dfew: A large-scale database for recognizing dynamic facial expressions in the wild","venue":null,"work_id":"b8fd6833-200b-4e37-afa6-b650300efc1f","year":2020},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:35.767077Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:af6c375e1b5be2d42c8eff6649cc0107710673d3982818c144cb7aa0161d03ca","observation_id":"e7c72394-096f-4d90-8344-71c77b1bb301","resolution":{"observed_at":"2026-08-06T23:48:38.821362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:35.861496Z","title":"Longvideobench: A benchmark for long- context interleaved video-language understanding.Advances in Neural Information Processing Systems, 37:28828–28857, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:35.861496Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:2561de419202c7c8244a52728f7b28a51188f716346c2f92c72e4b6a064309f4","observation_id":"a0df6ca4-fdf4-447a-850d-7e9688d04544","resolution":{"observed_at":"2026-08-06T23:48:35.861496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:35.947030Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:35.947030Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:c1e299441dac5358cdddbaa5445b4482822a7473fa5110f9729cce69358d373a","observation_id":"22a0426f-ac6a-4cdc-933e-c641f0d5a4d0","resolution":{"observed_at":"2026-08-06T23:48:35.947030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:38.476191Z","title":"Tempcompass: Do video llms really understand videos? InFindings of the Association for Computational Linguistics ACL 2024, pages 8731–8772, 2024","venue":null,"work_id":"807bb7c4-5fa3-4f78-9207-5ef9532805fd","year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:36.039772Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:a63709e6faaacf7b8dd44867b374c8d74e7c1707c5569942dfcc508e92058da9","observation_id":"db357cd1-ea01-459b-945c-e6a9cfcee43c","resolution":{"observed_at":"2026-08-06T23:48:38.593156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:36.245848Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:36.245848Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:2edbff2971d2d32696eccb0c2b4909cd2ee3072a0c4bc5c7e1fb87fcdac74df5","observation_id":"b6b4a07a-446e-465a-b0b2-fc16fed427ae","resolution":{"observed_at":"2026-08-06T23:48:36.245848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T23:48:36.371774Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:36.371774Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:24c7a9477176594a2658b7b27030f463560210e7f40e8a188dc92c9bb6ce62a5","observation_id":"8120ea48-5a60-4ed9-b67c-264cbe53d991","resolution":{"observed_at":"2026-08-06T23:48:36.371774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T23:48:36.504016Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:36.504016Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:31b8a3b4a1d380f7613e1049865ae06b4427358a416f0d1d42e63fbbe1eae869","observation_id":"d1bee5ad-baba-454a-9bb7-b7384a0c64e1","resolution":{"observed_at":"2026-08-06T23:48:36.504016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:36.600274Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:36.600274Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:8c9851df630dc9d1f38bf7b9731b9e372187b20dd0a9e9a5983a5ac19562b946","observation_id":"52bd632d-3da6-4f60-8a1d-5a5eb892d476","resolution":{"observed_at":"2026-08-06T23:48:36.600274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T23:48:36.680253Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms.arXiv preprint arXiv:2406.07476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:36.680253Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:6163f87129856e736c8c5cb03747e7d50cb80585a64dfcbff58e206b4a2a1023","observation_id":"9fa98f0e-5053-4c37-abe0-bb1c03d95e62","resolution":{"observed_at":"2026-08-06T23:48:36.680253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T23:48:36.814956Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:36.814956Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:72eca2edb8b9c06f7bf3f7918090597bf66713bfa6a5b9ea7cea2d953937dce0","observation_id":"0b8f8ce4-9400-4786-81bd-7c484317d5cc","resolution":{"observed_at":"2026-08-06T23:48:36.814956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:36.999749Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:36.999749Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:66b0ff9519f9d93f6da40f4e8c43c09de59fc66795642364730c64df0b39449d","observation_id":"94c136af-0e49-4990-a1f1-2c94e53f5172","resolution":{"observed_at":"2026-08-06T23:48:36.999749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12081","last_updated":"2025-02-17T17:55:55Z","snapshot_observed_at":"2026-08-10T09:10:13.258194Z","submitted_at":"2025-02-17T17:55:55Z","title":"Unhackable Temporal Rewarding for Scalable Video MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12081","snapshot_observed_at":"2026-08-06T23:48:37.181614Z","title":"Unhackable temporal rewarding for scalable video mllms.arXiv preprint arXiv:2502.12081, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:37.181614Z"},"links":{"cited_paper":"/paper/2502.12081","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:730ce3310619d25307b28215a27210467418a94e9145610a13d63d64c3e60602","observation_id":"847d3506-46b5-4ed4-996a-c47b8e2c793e","resolution":{"observed_at":"2026-08-06T23:48:37.181614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T23:48:37.284629Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:37.284629Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:5d4b24a29b05ccb878685c38c69e5cb8d077c18cf9d8167fee3d9942c05d87a7","observation_id":"cd5f36df-dc5c-4131-8cbc-28b81e2c7ef5","resolution":{"observed_at":"2026-08-06T23:48:37.284629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-08-10T11:57:00.228306Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-08-06T23:48:37.373080Z","title":"Kangaroo: A powerful video-language model supporting long-context video input.arXiv preprint arXiv:2408.15542, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:37.373080Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:7fd847ee42b369abcd0acad821c43c41c8826d36b9ea3a30d3902a64a3e26085","observation_id":"d2d036f9-03e3-4183-a4e4-e3dade6832b8","resolution":{"observed_at":"2026-08-06T23:48:37.373080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-08-10T08:02:13.965614Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-06T23:48:37.464542Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces.arXiv preprint arXiv:2412.14171, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:37.464542Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:79cb299b836ae97ecb768069de7546afaf1c5b00448c655354d2aab6ce278388","observation_id":"a6198fb0-460d-4309-8991-d026ef49699f","resolution":{"observed_at":"2026-08-06T23:48:37.464542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-06T23:48:37.556314Z","title":"Video-mmmu: Evaluating knowledge acquisition from multi-discipline professional videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:37.556314Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:022a3bc7e4d7bf015ffc4b7a9459235cc952f14344844e7ce08bdb8e83e084ba","observation_id":"7e2d0813-3723-406c-9f37-99613b9ef861","resolution":{"observed_at":"2026-08-06T23:48:37.556314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-08-10T17:10:37.256228Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-06T23:48:37.656075Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding.arXiv preprint arXiv:2501.12380, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:37.656075Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:8732093163b54ba0dad78b85718ecb61996c2038e1f97cb67ac56e4906b31d54","observation_id":"cfb50d06-db4a-4122-b1a9-f8f7b1410dc9","resolution":{"observed_at":"2026-08-06T23:48:37.656075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T23:48:37.725055Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:37.725055Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:31e8eb570c52941201585df4203ab1c071e97b60afd065ef12951e4abe602971","observation_id":"c93b68ad-4f32-4fad-90d7-69d5909b854a","resolution":{"observed_at":"2026-08-06T23:48:37.725055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 13 inbound Pith citation observations for arXiv:2506.16141."}