{"as_of":"2026-08-13T18:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:43bada9431310b0acbfad597172a76100b7395ca54f45f190d253d209bef5372","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:36:01.084911Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07581/citation-record","integrity":"/paper/2608.07581/integrity","json":"/paper/2608.07581/citation-record.json","paper":"/paper/2608.07581"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T00:36:00.968747Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:00.968747Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:dcd3da8dbeee3b0e74a89007106b7a73d116729e8b377777d51a9f8a21d670ff","observation_id":"bcc858e9-2c85-480e-b2b0-86ffc1b3ffec","resolution":{"observed_at":"2026-08-11T00:36:00.968747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.554488Z","title":null,"venue":null,"work_id":"57111ebc-b3c2-440c-b8fb-4078f5cca2ec","year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:00.972707Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:ef5235335c55db00eb637ffdce96297fe67474ca13bc787d5b94f93949977e39","observation_id":"dfd166a4-ba88-4690-96f9-c1abb37e5db3","resolution":{"observed_at":"2026-08-11T00:36:01.557255Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-11T00:36:00.975962Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:00.975962Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:0b6c4cf62a66b56227096857c30ea2171c279c86db2f0eddf81bbc0bd48acf1f","observation_id":"afdffb96-1086-4ee0-ac21-d9691563c3d1","resolution":{"observed_at":"2026-08-11T00:36:00.975962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-11T00:36:00.979284Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:00.979284Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:25c5d90e04c7fa82029fd58c99c384f17877f8573d501fa3c519bfe603f696d2","observation_id":"42ebee1d-af1e-4d55-962d-4173f2797270","resolution":{"observed_at":"2026-08-11T00:36:00.979284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-11T00:36:00.982550Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:00.982550Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:a2f237bbe408f49c76c089167e588bafa0118843d82e467c63295e4c3d8db50f","observation_id":"b48126ed-e5b0-4c55-9e1c-282650858c1e","resolution":{"observed_at":"2026-08-11T00:36:00.982550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-11T00:36:00.985579Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:00.985579Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:a3788fac638c6358cfef2b5fc76f05d014ea832f424727d56c955ecf1fbcf214","observation_id":"253aa727-6c76-42a7-95bc-4e52d27df8c3","resolution":{"observed_at":"2026-08-11T00:36:00.985579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:00.989085Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:00.989085Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:44f6a31175124c00df5f2ea048887ecab84a937f3d5e9b440f338132e1cc9847","observation_id":"f7d123c6-4c8c-45ee-a00a-f1511d78138a","resolution":{"observed_at":"2026-08-11T00:36:00.989085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12800","last_updated":"2025-08-29T10:05:13Z","snapshot_observed_at":"2026-08-13T07:34:29.888681Z","submitted_at":"2025-08-18T10:23:10Z","title":"Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12800","snapshot_observed_at":"2026-08-11T00:36:00.994456Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:00.994456Z"},"links":{"cited_paper":"/paper/2508.12800","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:f0f25bdc6342802805e73353b94f99a0fe84d29eef3dee72d5171f58d44e4895","observation_id":"267c2edd-0536-43d5-abcb-1d548312f3af","resolution":{"observed_at":"2026-08-11T00:36:00.994456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.542503Z","title":null,"venue":null,"work_id":"a028ccf2-77ec-457b-8e61-fa222dcc9e67","year":2026},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:00.997566Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:eaa3a2b16bb4677b8707c3f6921e4ff8736ed7099c99ef891e69951019481a55","observation_id":"f6e568da-3383-4219-aed2-934e79408e10","resolution":{"observed_at":"2026-08-11T00:36:01.545458Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.534628Z","title":null,"venue":null,"work_id":"31bc3661-7bab-4df7-8b99-79b7c891d06f","year":null},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.000236Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:2a43b90bbcc50da4e7167596ec76b38eceb4d394f8741f7b7fa62a0875f48a05","observation_id":"4a4c56c3-cc2e-4222-986b-f8c8e49df15d","resolution":{"observed_at":"2026-08-11T00:36:01.537651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-11T00:36:01.003086Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.003086Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:1d7628abdf5cebc8f9c2185796f03a4c1fa6956482282e7ac8acaee6c0810896","observation_id":"113237e0-7488-4f53-ba33-eab608327b9f","resolution":{"observed_at":"2026-08-11T00:36:01.003086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.526814Z","title":null,"venue":null,"work_id":"6cd1af75-b4b1-42c9-8cfe-0bd9ec53184f","year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.005837Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:5394d3c7fc9f6af5975a746e9ad9c6cac9c8caf0c4e398bef71b471e38b79644","observation_id":"97492cea-090f-4037-a82d-ea53535adefd","resolution":{"observed_at":"2026-08-11T00:36:01.529428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-11T00:36:01.008576Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.008576Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:5e95963a85f6c987f7e6995dca84ce2481278d0f0298b6c0d6e6b2656ae1cde7","observation_id":"23605e2c-8ddd-4081-9b79-0d8fc15a111f","resolution":{"observed_at":"2026-08-11T00:36:01.008576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-11T00:36:01.011369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.011369Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:a56363a1b9e7e21b250b8c15e0bfe5956040ec7c71adbcf20c0134a9ccbc2253","observation_id":"b7060bc9-2abc-4d04-9b92-81cc05cc0c4a","resolution":{"observed_at":"2026-08-11T00:36:01.011369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.519006Z","title":null,"venue":null,"work_id":"affd0aa2-d7bc-4bba-a253-f1baa451d654","year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.014447Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:bba30731e89ad4f6fc1afbe84d3031e5da238553d8da393c35cf08fc78000766","observation_id":"aaad2af5-b7df-4a2a-bb56-63acccfec38b","resolution":{"observed_at":"2026-08-11T00:36:01.521879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17445","last_updated":"2025-08-24T16:52:37Z","snapshot_observed_at":"2026-08-11T21:54:58.560841Z","submitted_at":"2025-08-24T16:52:37Z","title":"TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17445","snapshot_observed_at":"2026-08-11T00:36:01.017092Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.017092Z"},"links":{"cited_paper":"/paper/2508.17445","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:e1efb3e86b93aaf018aa55e6d602f5b3b20bae6d79cbb0dfe16497422a93381c","observation_id":"3c826a07-a80f-46a4-b267-3abea1d0865e","resolution":{"observed_at":"2026-08-11T00:36:01.017092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.019846Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.019846Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:3176c2620cc5da5613c982c3e38f8684ae1f5dfb7bd95634fd2ce660c4ab13c6","observation_id":"e9d5b877-3a00-45f1-be99-124b6b875cb9","resolution":{"observed_at":"2026-08-11T00:36:01.019846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-11T00:36:01.022292Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.022292Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:a8e9e88dbaf3212d4c94b8c49a6d5ea7f69309ee904abd35c0ad296115d80bff","observation_id":"ba49155b-49b8-4ecf-87a5-ee1ca0475d31","resolution":{"observed_at":"2026-08-11T00:36:01.022292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04165","last_updated":"2021-07-20T23:22:27Z","snapshot_observed_at":"2026-08-06T13:29:31.050456Z","submitted_at":"2021-05-10T07:46:55Z","title":"Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04165","snapshot_observed_at":"2026-08-11T00:36:01.025134Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.025134Z"},"links":{"cited_paper":"/paper/2105.04165","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:6b32b2dd5a58b6a09d1328216512c0b8d5591855e3ab6c7e8f3e264f066afc70","observation_id":"09a0a754-b403-4527-be31-829b8138caa7","resolution":{"observed_at":"2026-08-11T00:36:01.025134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.510334Z","title":null,"venue":null,"work_id":"f767414d-038f-4144-874d-c1edb02d91de","year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.028118Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:e051783ed6517afe4b95375dfefa5d1139dae246583983ef50c2319cb14c273b","observation_id":"21633ddb-1b6a-4adc-bebf-3f93f69a07f2","resolution":{"observed_at":"2026-08-11T00:36:01.513081Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-11T00:36:01.030834Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.030834Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:71a8cb0e69e66ce8f51e87813d1bedd3a0bf6c9e502d462847cd7016247c418f","observation_id":"8b4c6a54-e0d3-4daa-86c6-0a10897c94ef","resolution":{"observed_at":"2026-08-11T00:36:01.030834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-11T00:36:01.033818Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.033818Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:b1d9e16042a7fb80b8aa77e230a4e7bc8d7d150fa5cfd8e8f0e274a18a7f8a0a","observation_id":"dd4ccb93-5a99-4f34-81cd-c8dca86021e4","resolution":{"observed_at":"2026-08-11T00:36:01.033818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.16947","last_updated":"2026-07-18T20:03:50Z","snapshot_observed_at":"2026-08-07T14:13:12.484072Z","submitted_at":"2026-07-18T20:03:50Z","title":"When Physical Preferences Meet Semantic Constraints: Physical and Semantic Direct Preference Optimization for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2607.16947","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.16947","snapshot_observed_at":"2026-08-11T00:36:01.306938Z","title":"When Physical Preferences Meet Semantic Constraints: Physical and Semantic Direct Preference Optimization for Text-to-Video Generation","venue":"cs.CV","work_id":"23ff471d-39f3-4e7e-8deb-11acbc84bd06","year":2026},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.036574Z"},"links":{"cited_paper":"/paper/2607.16947","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:00f7c3264b772370a8c90e55f5610ecd09fca4551b07bb657bfbb9b93bded69b","observation_id":"1fd55159-d00a-4060-885b-2c879ece720d","resolution":{"observed_at":"2026-08-11T00:36:01.312293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-08-12T06:11:26.786967Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-11T00:36:01.039435Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.039435Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:9d7ae34eea288928a4043f0552a55818d78c81b466aa8133b986374820772fe2","observation_id":"bf870af3-7ec5-4309-bf4f-d650250b6261","resolution":{"observed_at":"2026-08-11T00:36:01.039435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.502512Z","title":null,"venue":null,"work_id":"0b04be7a-39d3-4394-ab82-a249beb2bb5d","year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.042321Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:26fcdd30742b3419a52e581e7225228255b1247efc6fe7f27570fad061138a6e","observation_id":"d30159e5-8b9e-49f6-b35e-03a37328e9b4","resolution":{"observed_at":"2026-08-11T00:36:01.505262Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.494783Z","title":null,"venue":null,"work_id":"b3754124-c241-4a03-9104-831c7fc1388e","year":2026},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.044931Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:19778752b5850fe0156a7ba9064f294fd2fd5e15ae01b17b88d024052140e63f","observation_id":"37162f79-8e37-45d3-90bc-e8e0baec79db","resolution":{"observed_at":"2026-08-11T00:36:01.497435Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-11T00:36:01.047616Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.047616Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:640f39eaef3e75bdc71226b54fcb2a30a36c0f68e799a666ad865fa05b3922fb","observation_id":"dd410201-fb9e-493f-82c3-dd805918cdae","resolution":{"observed_at":"2026-08-11T00:36:01.047616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.050562Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.050562Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:e0f990a1f3ff6019d1fcd54d1e7fa6e29b410dbe28b6b249bc9f6821d0717f9e","observation_id":"6b83e7a8-4513-484c-9150-04db192292b0","resolution":{"observed_at":"2026-08-11T00:36:01.050562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07934","last_updated":"2025-05-30T15:53:16Z","snapshot_observed_at":"2026-08-12T13:11:38.446061Z","submitted_at":"2025-04-10T17:49:05Z","title":"SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07934","snapshot_observed_at":"2026-08-11T00:36:01.053166Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.053166Z"},"links":{"cited_paper":"/paper/2504.07934","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:e438f5c155d752a4f3088d36bcf05995e7091d92df941f700937bb17030575d3","observation_id":"21dea8d1-a349-4d73-afc9-6085a711eb7e","resolution":{"observed_at":"2026-08-11T00:36:01.053166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-11T00:36:01.056098Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.056098Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:8c198accda6c0b70f1d55a01439d9125ff842f9dc8d9f0f7c9b1951d2382260e","observation_id":"8403012f-6a3b-44ed-aa5b-92cdd066c3d7","resolution":{"observed_at":"2026-08-11T00:36:01.056098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.058958Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.058958Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:be1a4f62643d1113eea8976e7557a622edcf06da7a8a7133a2472cc7c119f728","observation_id":"4cbd1c43-68bd-457b-9c40-68ad9b565561","resolution":{"observed_at":"2026-08-11T00:36:01.058958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16673","last_updated":"2025-05-22T13:39:32Z","snapshot_observed_at":"2026-08-07T14:55:04.641472Z","submitted_at":"2025-05-22T13:39:32Z","title":"R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16673","snapshot_observed_at":"2026-08-11T00:36:01.061794Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.061794Z"},"links":{"cited_paper":"/paper/2505.16673","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:e4982bf4bf8b4b5b680029d2b21bf63ec9fe837b4693ad2e9f92e1f90d4972b6","observation_id":"7c5df10b-470b-4ac5-98be-8c1270150d93","resolution":{"observed_at":"2026-08-11T00:36:01.061794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-11T00:36:01.064518Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.064518Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:467c4747578ffd94ef27e94e02aff7254a9ea93237799bc67fc5d8696b1c525a","observation_id":"74ec1b88-93e0-49d3-af6a-f1c2b3b09c3a","resolution":{"observed_at":"2026-08-11T00:36:01.064518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-13T01:30:54.104133Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-11T00:36:01.067584Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.067584Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:e90c0eb9aa6dff23069329b7d505e1f030205502674095ce607d9e91325b02ff","observation_id":"3f1e23d8-8ba2-4c1b-8af7-a4fded0586a9","resolution":{"observed_at":"2026-08-11T00:36:01.067584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.482783Z","title":null,"venue":null,"work_id":"bc619c6f-f525-4a50-9b2f-01e28be81d65","year":2024},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.070552Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:d2b118b80279b02f01baabf2812fc8fae441dd9f7ab1cdb8cfa9528debe4d6e8","observation_id":"4032bd1c-5083-46a1-a163-72ec5eaf19d6","resolution":{"observed_at":"2026-08-11T00:36:01.485564Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.073147Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.073147Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:0f94e724a0433a9a3e3ee55131d1ffa0481dde4a2d9dee97d62d49b8d58f1a7d","observation_id":"abf73bd4-8eb0-4be9-bdda-dc5ad1175fe1","resolution":{"observed_at":"2026-08-11T00:36:01.073147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-11T00:36:01.079000Z","title":"Zhihong Shao, Peiyi Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.079000Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:43cfa6f458251d783ba71b142fb5efbfdd21491c362891fe4d38ad0572113e9f","observation_id":"170634ff-68b2-45db-8775-ec9d71c43d34","resolution":{"observed_at":"2026-08-11T00:36:01.079000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-12T16:05:52.077251Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-11T00:36:01.075961Z","title":"arXiv:2507.18071 [cs.LG] https: //arxiv.org/abs/2507.18071","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.075961Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:6dcfa1b42a23c0c25b1d03f4629f0d01c6e02e6876abdc12977359609c4eb941","observation_id":"9d5a108e-0298-4566-8b53-50a1771d1f31","resolution":{"observed_at":"2026-08-11T00:36:01.075961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:36:01.084911Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.084911Z"},"links":{"citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:9065284c24610da615c71ea21edd3fa3cdaf36beca2523e21a91f679726169b9","observation_id":"f6ac86ed-8a9f-4448-be1f-c4ba65ce1736","resolution":{"observed_at":"2026-08-11T00:36:01.084911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-11T00:36:01.081871Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:01.081871Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:73a2ca8f55b3931b82ba7cc6a0efb76174cc0ade82a2c626c3614db6cfdc0016","observation_id":"9b9b55b2-539a-4808-97f4-9198ae0094d1","resolution":{"observed_at":"2026-08-11T00:36:01.081871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-11T00:36:00.991604Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T00:36:00.991604Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2608.07581"},"observation_digest":"sha256:c071dbbde33792f36c17a205bdb45ca382bc94495d838d537be6c9cf3c38603d","observation_id":"6179ed9e-bd58-467e-a60d-6adb24ec082f","resolution":{"observed_at":"2026-08-11T00:36:00.991604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.07581","last_updated":"2026-08-05T04:00:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T18:13:11.969034Z","submitted_at":"2026-08-05T04:00:09Z","title":"Multi-Branch Policy Optimization for Multimodal Large Language Models"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2608.07581."}