{"as_of":"2026-08-10T04:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bdd33ebd6558f9a0da7c18110e820ec10688279cda6dd2d1fb5221607fa2218c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:07:04.359664Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T23:57:29.062496Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-07T15:07:04.359664Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning.arXiv preprint arXiv:2505.02835, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16401","last_updated":"2025-06-12T15:02:59Z","snapshot_observed_at":"2026-08-07T14:59:29.508178Z","submitted_at":"2025-05-22T08:52:21Z","title":"Divide-Fuse-Conquer: Eliciting \"Aha Moments\" in Multi-Scenario Games","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:04.359664Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2505.16401"},"observation_digest":"sha256:751ab044e07ed5dd0e3e0c4db23af95d558c8658d8713f806b0c18aafea0d147","observation_id":"e582f9d6-11e4-4597-8b15-4d8479bce771","resolution":{"observed_at":"2026-08-07T15:07:04.359664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-07T14:31:22.005729Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":146,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:22.005729Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:57b02fba2853f3356dcb3b080fa7094b6cabb52e25e93170fdd286230413e145","observation_id":"6c8f6167-1acb-41c8-b638-8ff1fd1d1978","resolution":{"observed_at":"2026-08-07T14:31:22.005729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2505.24499","last_updated":"2026-04-09T03:43:40Z","snapshot_observed_at":"2026-08-02T11:03:18.724908Z","submitted_at":"2025-05-30T11:57:58Z","title":"Reason-SVG: Enhancing Structured Reasoning for Vector Graphics Generation with Reinforcement Learning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-19T13:00:27.232079Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2505.24499"},"observation_digest":"sha256:ae9e180b5abd60a34bb7063550ec31a6fa0a074843f0f4d4612077c536841f0d","observation_id":"aecb0807-75d4-4cd1-9858-fbf31d88585b","resolution":{"observed_at":"2026-05-19T13:02:18.180265Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-07T11:05:19.779262Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.779262Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:f2ea15529c6370807da9f806a54d80f7c8d315ce8fc9c2a1e873c6b9f0ad4283","observation_id":"5c512187-0b0e-4e92-b81e-804a018e0106","resolution":{"observed_at":"2026-08-07T11:05:19.779262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-05T13:24:39.958836Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.958836Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:329631c843313b71363e86d1b53f91bf6cc1bfa568f85874ddd9debfd50d7cc1","observation_id":"c14f5cbe-4c50-4d78-8a14-f4c8a8024c93","resolution":{"observed_at":"2026-08-05T13:24:39.958836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-05T11:39:25.091160Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-07T15:24:21.164792Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:25.091160Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:4b4a3c1995c5a57097413d625dd7f032f939fb38031dd7b8e1984c9bf39a7ff3","observation_id":"c7f2a4b8-a266-44fe-b9f7-48d2ba1cb883","resolution":{"observed_at":"2026-08-05T11:39:25.091160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-03T03:37:50.232604Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2602.07533","last_updated":"2026-06-26T15:22:02Z","snapshot_observed_at":"2026-08-08T11:16:05.235804Z","submitted_at":"2026-02-07T13:09:41Z","title":"Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T03:37:50.232604Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2602.07533"},"observation_digest":"sha256:b89ac40566bda66742a41751402410d3e587c0ee146b5dc8cc712b60347562e9","observation_id":"fb148a72-3212-457f-8a67-f271635f405f","resolution":{"observed_at":"2026-08-03T03:37:50.232604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-02T19:56:33.297932Z","title":"R1-Reward: Train- ing Multimodal Reward Model Through Stable Reinforce- ment Learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.297932Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:81c47038f16f1a72d08fe848a23693b956fa0d57e00dad7612a06be4f57badc9","observation_id":"0e55930e-bd20-4101-a527-91a1f656848d","resolution":{"observed_at":"2026-08-02T19:56:33.297932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-02T19:53:08.856440Z","title":"R1-reward: Training multimodal reward model through stable rein- forcement learning.arXiv preprint arXiv:2505.02835,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:08.856440Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:fa80b103ec910ed088b3f3c40e636305a99e35b9b99a4519402a523fbe006fc7","observation_id":"20f7ae9c-bff9-4157-9b2c-6b5ac5d508e4","resolution":{"observed_at":"2026-08-02T19:53:08.856440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2604.08905","last_updated":"2026-04-10T03:13:19Z","snapshot_observed_at":"2026-07-06T22:57:55.179136Z","submitted_at":"2026-04-10T03:13:19Z","title":"StaRPO: Stability-Augmented Reinforcement Policy Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T18:11:49.056805Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2604.08905"},"observation_digest":"sha256:65ceb7900c00ba5aadd5be73e49ed6dcc8c2b014987c544313e17cb4dc05a2b6","observation_id":"8e4116c8-75f2-4c32-9b37-a1a6eb7e9797","resolution":{"observed_at":"2026-05-11T05:20:59.984367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2604.14910","last_updated":"2026-04-27T07:40:23Z","snapshot_observed_at":"2026-07-06T23:02:36.062162Z","submitted_at":"2026-04-16T11:52:11Z","title":"Reward-Aware Trajectory Shaping for Few-step Visual Generation","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T11:43:55.499474Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2604.14910"},"observation_digest":"sha256:247c5ab2a3a0a4d6b13f54aef87f92c2e67e854003a33cd8a8d5d5affa4ef281","observation_id":"3dc8ab51-8e38-4a81-9a20-817baa9ba334","resolution":{"observed_at":"2026-05-10T11:45:21.293870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2604.19544","last_updated":"2026-04-21T15:02:50Z","snapshot_observed_at":"2026-07-06T23:06:12.542013Z","submitted_at":"2026-04-21T15:02:50Z","title":"DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T01:45:30.001398Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2604.19544"},"observation_digest":"sha256:1763edfc3ad150fc5f2abf8e47dc3674dd6b34376d75835ca5e79f989a828c90","observation_id":"38709681-ae0f-4c6b-be99-0233d59b65eb","resolution":{"observed_at":"2026-05-11T13:26:03.799793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2604.24339","last_updated":"2026-04-27T11:31:15Z","snapshot_observed_at":"2026-07-06T23:10:24.992210Z","submitted_at":"2026-04-27T11:31:15Z","title":"See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-08T04:46:16.497585Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2604.24339"},"observation_digest":"sha256:c3480eaa09a0fbcbae2dbbc01421fa1dedb179418d7598a044c5168c1308096e","observation_id":"876803e7-4eab-4ff8-8f2a-be4e5e29c7ac","resolution":{"observed_at":"2026-05-11T21:36:17.471032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2605.05922","last_updated":"2026-05-12T06:25:12Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T09:30:58Z","title":"Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T07:37:52.346280Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2605.05922"},"observation_digest":"sha256:d6b186cf79c7964d1b4044cdd33b298d47eb2d818a853f9604860852cba92cdd","observation_id":"61e56765-442a-4be9-8d1b-b0dac92a37be","resolution":{"observed_at":"2026-05-13T07:42:30.874973Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2605.05965","last_updated":"2026-05-07T10:11:51Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:11:51Z","title":"Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-09T15:39:54.001327Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2605.05965"},"observation_digest":"sha256:ce2206fa7646d97a8c235fd0abfc6a22823787dcbacf8bc055d3d3f2e4a3383f","observation_id":"fe7449d0-f8bb-4331-ae5c-70692f8d852c","resolution":{"observed_at":"2026-05-11T16:36:10.508835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2605.07872","last_updated":"2026-05-08T15:29:11Z","snapshot_observed_at":"2026-08-04T19:38:15.330922Z","submitted_at":"2026-05-08T15:29:11Z","title":"Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T02:18:20.880231Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2605.07872"},"observation_digest":"sha256:dcbaa5a90fa622d58d843664cb95c6bbec95a83be74f1b7b894d9f6b9ddfe282","observation_id":"fce63959-381a-47b7-97f9-ea0711fd5167","resolution":{"observed_at":"2026-05-11T03:45:58.385559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:9a8452fccd4dcd32d7a986903f05af35cb53a66ff47743118b62287310f1db4b","observation_id":"a04a95b7-c373-4b04-8db4-ace8ef5aa026","resolution":{"observed_at":"2026-05-12T06:01:24.224742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2605.09422","last_updated":"2026-05-10T08:48:58Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T08:48:58Z","title":"Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T03:57:57.791351Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2605.09422"},"observation_digest":"sha256:3b64274d65ad9fdcd16baea5350a22ef9392cb44ed6d1a94c0fb71f510342c0b","observation_id":"c2321188-055e-40e6-8c19-fc000d9dd49c","resolution":{"observed_at":"2026-05-12T06:46:52.586888Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2605.22104","last_updated":"2026-05-21T07:40:25Z","snapshot_observed_at":"2026-08-06T19:20:14.897862Z","submitted_at":"2026-05-21T07:40:25Z","title":"OPERA: An Agent for Image Restoration with End-to-End Joint Planning-Execution Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T07:19:57.063802Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2605.22104"},"observation_digest":"sha256:f6d3e81c105324592fbc7a50c5c760e918bab83aff0eec33d34bd668cd8fd9b9","observation_id":"bc2c86d0-8265-4c27-8395-a029444a507c","resolution":{"observed_at":"2026-05-22T07:21:12.728691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2605.25437","last_updated":"2026-05-25T05:29:07Z","snapshot_observed_at":"2026-08-06T20:41:42.426074Z","submitted_at":"2026-05-25T05:29:07Z","title":"Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T22:53:55.407461Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2605.25437"},"observation_digest":"sha256:157346cfdcc171d02f63501f61eb45a819284be86bff661c1c94cd3349c16191","observation_id":"4eadc967-8a10-4d7a-aed1-4aec89d466db","resolution":{"observed_at":"2026-06-29T22:54:00.573718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2606.09064","last_updated":"2026-06-08T06:02:05Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:02:05Z","title":"See More, Think Deeper: Query-Expanded Visual Evidence and Answer-Clue Guided Reflection for Long Video Understanding","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-27T17:35:07.667016Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2606.09064"},"observation_digest":"sha256:458557b8a1905b36d46315fb89133910537fe464afbfd73ff8c7b601a6632de1","observation_id":"fb54247d-0abd-426b-9a4a-ad51fb3942ac","resolution":{"observed_at":"2026-07-02T23:57:29.063754Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2505.02835 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":277,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:ccf27f3ad449f1bf11c180ad16df1eb807e507c05aa5eb97dfffe669358f8a27","observation_id":"078cae58-a97a-4fe8-8ac4-a95bd8ec0d75","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-31T14:08:11.243120Z","title":"thinking with images","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28225","last_updated":"2026-07-30T13:58:08Z","snapshot_observed_at":"2026-08-07T01:38:45.608115Z","submitted_at":"2026-07-30T13:58:08Z","title":"FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T14:08:11.243120Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2607.28225"},"observation_digest":"sha256:7ac397f366e5e8f2e67cd21284bde1855c17c5908aa90018bf3a886b776ee6dd","observation_id":"59f68406-5f9f-496c-b3a2-8f6e11c5da4b","resolution":{"observed_at":"2026-07-31T14:08:11.243120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.02835/citation-record","integrity":"/paper/2505.02835/integrity","json":"/paper/2505.02835/citation-record.json","paper":"/paper/2505.02835"},"outbound":[],"paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T17:48:39.771401Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2505.02835."}