{"as_of":"2026-08-17T18:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d4f1fa66d0517492129821676bfa34e774c0b9e1093bdfee17738ac933e3177","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:26:58.409542Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:09:10.990159Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T03:06:29.440180Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-08-15T23:09:10.990159Z","title":"Mindomni: Unleashing reasoning generation in vision language models with rgpo","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05422","last_updated":"2025-08-15T08:56:27Z","snapshot_observed_at":"2026-08-16T05:36:45.421294Z","submitted_at":"2025-05-08T17:12:19Z","title":"TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T23:09:10.990159Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2505.05422"},"observation_digest":"sha256:b77c6d163d843aeb82b1c245c03a36c146094a4911813f6778faf8aebb58e0a5","observation_id":"6bdc7cd4-ff7c-49a9-905d-1c637f54ce25","resolution":{"observed_at":"2026-08-15T23:09:10.990159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-08-07T11:16:20.624099Z","title":"arXiv preprint arXiv:2505.13031 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-16T04:47:40.348136Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:20.624099Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:5ee8b0c6a89d343a867fc2f9746f662034ec15b43626473bd627f5d74143000a","observation_id":"1b66d188-aedf-42e4-9b63-f192e703d310","resolution":{"observed_at":"2026-08-07T11:16:20.624099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-08-07T04:09:26.605018Z","title":"Bridging the gap: A unified video comprehen- sion framework for moment retrieval and highlight de- tection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11638","last_updated":"2025-06-13T10:11:01Z","snapshot_observed_at":"2026-08-14T08:05:44.396132Z","submitted_at":"2025-06-13T10:11:01Z","title":"LoRA-Gen: Specializing Large Language Model via Online LoRA Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:26.605018Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2506.11638"},"observation_digest":"sha256:5b99863183be93e6a2746c2d724180923210eae40b8cc55ab0e375ddd138f86d","observation_id":"15fdf608-50a4-443a-b870-878a7cd630e2","resolution":{"observed_at":"2026-08-07T04:09:26.605018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-07-13T23:27:11.006580Z","title":"arXiv preprint arXiv:2505.13031 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-17T03:37:13.586856Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-13T23:27:11.006580Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:e8b4bce9c4803b5b240d3afd1a6d83f2e9216e1a7e957b4e22940b8fb06d1e7b","observation_id":"21e7eaad-27fb-40a0-a9c9-acdb4d3b6e1d","resolution":{"observed_at":"2026-07-13T23:27:11.006580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-08-03T02:34:00.137676Z","title":"arXiv preprint arXiv:2505.13031 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-17T03:37:13.586856Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:00.137676Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:4510ba6f59cb570531b36ee97a36bc49fb251a34ab31135ff2d86ca9b8cb5cef","observation_id":"a0967b82-5fb2-430d-ae00-a9f2fe1aabca","resolution":{"observed_at":"2026-08-03T02:34:00.137676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":"2505.13031","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-07-02T03:06:29.440180Z","title":"Mindomni: Unleashing reasoning generation in vision language models with rgpo","venue":null,"work_id":"2dfd098c-2b10-4fe1-a491-d819f974d7d4","year":2025},"citing_paper":{"arxiv_id":"2604.04911","last_updated":"2026-04-08T04:54:06Z","snapshot_observed_at":"2026-08-12T15:46:16.847409Z","submitted_at":"2026-04-06T17:54:42Z","title":"SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T19:23:50.614589Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2604.04911"},"observation_digest":"sha256:0321d350c70b3aa3254309eed7614ec4dc81572b7abf5442a16aa38734096535","observation_id":"17c4f5ff-d6f3-4ac4-b784-185498c4a051","resolution":{"observed_at":"2026-05-10T23:00:50.371078Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":"2505.13031","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-07-02T03:06:29.440180Z","title":"Mindomni: Unleashing reasoning generation in vision language models with rgpo","venue":null,"work_id":"2dfd098c-2b10-4fe1-a491-d819f974d7d4","year":2025},"citing_paper":{"arxiv_id":"2605.04128","last_updated":"2026-05-20T08:56:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T15:49:47Z","title":"JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-08T17:57:08.606559Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2605.04128"},"observation_digest":"sha256:7595c5b7cfbc3581900fc2c8408b759ff7327897d8aa8952e7e41999cd42678e","observation_id":"d7b75b5d-a3ce-440c-b68a-90040d96e677","resolution":{"observed_at":"2026-05-09T06:55:43.694718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":"2505.13031","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-07-02T03:06:29.440180Z","title":"Mindomni: Unleashing reasoning generation in vision language models with rgpo","venue":null,"work_id":"2dfd098c-2b10-4fe1-a491-d819f974d7d4","year":2025},"citing_paper":{"arxiv_id":"2605.04128","last_updated":"2026-05-20T08:56:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T15:49:47Z","title":"JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-21T08:15:58.020894Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2605.04128"},"observation_digest":"sha256:ae4a24301d9c7d2f837630a706b7714f1cfad54cec49bdc28271ac57ffd386c6","observation_id":"f35ec559-82e5-404d-9f3a-262d9319b7cb","resolution":{"observed_at":"2026-05-21T08:19:52.751849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":"2505.13031","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-07-02T03:06:29.440180Z","title":"Mindomni: Unleashing reasoning generation in vision language models with rgpo","venue":null,"work_id":"2dfd098c-2b10-4fe1-a491-d819f974d7d4","year":2025},"citing_paper":{"arxiv_id":"2605.07334","last_updated":"2026-05-08T06:39:53Z","snapshot_observed_at":"2026-08-12T22:45:35.785489Z","submitted_at":"2026-05-08T06:39:53Z","title":"RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T01:16:25.031349Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2605.07334"},"observation_digest":"sha256:da7e2a32b67c6a210da62943f088f9b9a9b9b89d5402fb5d4daaa85631f31980","observation_id":"3c0041f6-f342-4a24-b0d8-2bfd251871a0","resolution":{"observed_at":"2026-05-11T04:30:59.889877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":"2505.13031","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-07-02T03:06:29.440180Z","title":"Mindomni: Unleashing reasoning generation in vision language models with rgpo","venue":null,"work_id":"2dfd098c-2b10-4fe1-a491-d819f974d7d4","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:6615c4514716470c343746b0979d6416b06c57136a0b8d2c37dff0c92a59fee7","observation_id":"a6585bc5-4f90-46ac-91cc-5b059183f3b2","resolution":{"observed_at":"2026-07-02T03:06:29.442237Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13031/citation-record","integrity":"/paper/2505.13031/integrity","json":"/paper/2505.13031/citation-record.json","paper":"/paper/2505.13031"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T20:26:58.092350Z","title":"5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.092350Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:1c4833e51aef3f49c7723e1ef7fa32f0bd2edb78bb4dd47c9676007deff52f6f","observation_id":"7431ca4d-00fc-4ac9-ba5b-c7a196d5b8f2","resolution":{"observed_at":"2026-08-15T20:26:58.092350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-08-16T09:34:56.272667Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-15T20:26:58.099262Z","title":"arXiv preprint arXiv:2505.09568 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.099262Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:01570ad5d6a94ac45468feb449ebfea2d0ed33f232ad4806bf5fa598ce7e5c45","observation_id":"a51e9c89-782f-4e8b-966d-59c6fb7bd70c","resolution":{"observed_at":"2026-08-15T20:26:58.099262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-15T20:26:58.105088Z","title":"arXiv preprint arXiv:2310.00426 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.105088Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:c88723f81581b6aca2d35f70d36c4718af38c60be1b573382a40b7ab8f2275e4","observation_id":"389c266b-d5d5-4b08-8564-f988b4986220","resolution":{"observed_at":"2026-08-15T20:26:58.105088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:59.512412Z","title":"r1-v: Reinforcing super generalization ability in vision-language models with less than 3","venue":null,"work_id":"6f505fda-7434-4266-a8a7-2fe8df3c0b70","year":null},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.110901Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:c5f7c39ade60426069afaa8d2fdc4ec56f502f57b4c24d926866d42db2876e3c","observation_id":"1b0cfad7-a596-43a5-9889-8a122e251c33","resolution":{"observed_at":"2026-08-15T20:26:59.518115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:58.116559Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.116559Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:74f4d3cb3da2efcf73a76a685a300ff8e739e148583c95d598af1aa64e52909b","observation_id":"8d82be19-ace8-4e34-a7fa-675d7a3ffa2d","resolution":{"observed_at":"2026-08-15T20:26:58.116559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:59.482965Z","title":"Science China Information Sciences67(12), 220101 (2024) 10","venue":null,"work_id":"a0847431-bc8e-440a-ab7f-a017d6ddbc96","year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.121570Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:19dc4cfba2e9dad4bf5f954c716a3b40d6f09c8ea2d6f1c7636228c07607aeaf","observation_id":"766af505-288d-4f51-95e5-2adbc908af8d","resolution":{"observed_at":"2026-08-15T20:26:59.488898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-17T01:11:44.872398Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-15T20:26:58.126897Z","title":"arXiv preprint arXiv:2505.14683 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.126897Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:d447808f71d5f5541127ae112d4263515c31d357099cc08421bcb77d275c37d2","observation_id":"d9523808-2f9f-45e0-8845-8718a37b2ac6","resolution":{"observed_at":"2026-08-15T20:26:58.126897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-16T14:59:02.096945Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-15T20:26:58.133735Z","title":"arXiv preprint arXiv:2309.11499 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.133735Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:d2a123c2743bdb85b39bee094b7944bf83ee9eb09311b705dfa1ee8261eda6ab","observation_id":"83349dd2-4b7d-4060-8d87-1c24a8796109","resolution":{"observed_at":"2026-08-15T20:26:58.133735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-15T20:26:58.139315Z","title":"arXiv preprint arXiv:2503.10639 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.139315Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:55e798f821b19cdf9e3a8c98cd45fc43abf9f9472b9fd960edccc4e586e7251c","observation_id":"71cab7d0-ea13-4b25-88de-9852fedef3cd","resolution":{"observed_at":"2026-08-15T20:26:58.139315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-08-16T14:56:32.402721Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-15T20:26:58.146231Z","title":"arXiv preprint arXiv:2309.17179 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.146231Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:fdb64dd0da3692ffbeb53da2de4bf00019b023d9f7460a3a30ead61aafa8e8f6","observation_id":"eee365db-c203-4bf0-a66f-19a157c902cb","resolution":{"observed_at":"2026-08-15T20:26:58.146231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-15T20:26:58.153083Z","title":"arXiv preprint arXiv:2404.14396 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.153083Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:18c818c8d8b3e9d42fb8573f3d11502e174742a877d998afb1ef19c294111e01","observation_id":"257300d6-e990-4252-a71f-e6d7c8cfda74","resolution":{"observed_at":"2026-08-15T20:26:58.153083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:59.464425Z","title":"Advances in Neural Information Processing Systems pp","venue":null,"work_id":"ca60f815-29b0-43c5-b65c-c87a40664044","year":2023},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.158664Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:7d702780b35628462bde3ec41675a48ca0f676175fe1f83f79c8ffc3833617b8","observation_id":"e2edbfb5-4dce-4b66-9659-d94dd2214f9d","resolution":{"observed_at":"2026-08-15T20:26:59.470305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:59.444956Z","title":null,"venue":null,"work_id":"78518e65-8788-4697-bb37-173049b2b01f","year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.163671Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:e298da707ea05196acfdb2ed97cc1320eba32ad4ee2f74e81368898b1215848b","observation_id":"25e2075e-38a0-460a-90fe-77141058ab01","resolution":{"observed_at":"2026-08-15T20:26:59.450727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T20:26:58.170393Z","title":"arXiv preprint arXiv:2501.12948 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.170393Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:b0cc9f858f8853d5bbd08bfe59b74cbe6568409e9e7d0748283de3aadc0dccc0","observation_id":"3fcd54f2-d329-46df-825b-d4fff51a8731","resolution":{"observed_at":"2026-08-15T20:26:58.170393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-08-13T08:10:57.391295Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-08-15T20:26:58.175229Z","title":"arXiv preprint arXiv:2501.13926 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.175229Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:6622ddd83bd100cc97a3ac64a9afdcebd7327c6c790de62fcb5a5128efddfbb1","observation_id":"7528f7ae-75b6-40a4-bb11-02e6e231d17d","resolution":{"observed_at":"2026-08-15T20:26:58.175229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-15T20:26:58.180483Z","title":"arXiv preprint arXiv:2403.05135 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.180483Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:4a5dd3769492813ef2eb8776598dd9565964fb105f67340cf8dada0f8fb16c5d","observation_id":"daf4f96a-731d-42e2-8f39-e4b1da2c1424","resolution":{"observed_at":"2026-08-15T20:26:58.180483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01934","last_updated":"2025-04-03T16:43:14Z","snapshot_observed_at":"2026-08-16T12:44:30.763992Z","submitted_at":"2025-04-02T17:45:00Z","title":"ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01934","snapshot_observed_at":"2026-08-15T20:26:58.185469Z","title":"arXiv preprint arXiv:2504.01934 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.185469Z"},"links":{"cited_paper":"/paper/2504.01934","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:a8b374fe4f91d5363638fbd226a10e2bd528df2120b9544ef455d188bd66de40","observation_id":"a90a0824-2081-47b8-928f-21aa3cabc3d1","resolution":{"observed_at":"2026-08-15T20:26:58.185469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-08-16T14:25:02.630375Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-15T20:26:58.192292Z","title":"arXiv preprint arXiv:2402.01694 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.192292Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:773e9a4eba9ec29c8bbc4fd3936f45c48ec3b885cbbb9b098f1b961493838b24","observation_id":"8f7ffe76-90bb-44b7-ad54-10d5e720510a","resolution":{"observed_at":"2026-08-15T20:26:58.192292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-08-16T03:33:39.637646Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-15T20:26:58.197909Z","title":"arXiv preprint arXiv:2409.12917 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.197909Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:5df981cc485cdcfcfee655ca97c06272d3f88db87625e8826edd8a635985567f","observation_id":"a4882627-c6d9-4a15-b758-8c0764825b81","resolution":{"observed_at":"2026-08-15T20:26:58.197909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:58.203015Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.203015Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:244ec8284203db073c6eb395d09c98d0e25607e092fd36357f00d36e7baea989","observation_id":"970508f6-7142-4887-a75f-fbc7eeecfd46","resolution":{"observed_at":"2026-08-15T20:26:58.203015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-15T20:26:58.208127Z","title":"arXiv:2408.03326 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.208127Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:e3f4305adbe7aa80c20d575d855723140ccacbb24eca67cbc09bba9a1d241d71","observation_id":"18aca474-96d7-4523-ba18-750605542886","resolution":{"observed_at":"2026-08-15T20:26:58.208127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-16T12:51:49.357503Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-08-15T20:26:58.214608Z","title":"arXiv preprint arXiv:2503.06520 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.214608Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:e71f24ff647bb702c4fec27607b2c2a928e5225395d80587ad422a28ae824a3c","observation_id":"6a3dfc0b-2b32-446e-a4c0-85130968bbd0","resolution":{"observed_at":"2026-08-15T20:26:58.214608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-16T12:51:32.079370Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-08-15T20:26:58.220542Z","title":"arXiv preprint arXiv:2503.07265 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.220542Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:e4d72eb917c1b18d77f39661d93202997b3684d486214418c586ddc15ebe8f9e","observation_id":"97f83c26-75db-462e-ab39-20c7d35cdd82","resolution":{"observed_at":"2026-08-15T20:26:58.220542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:59.413777Z","title":"https://openai.com/o1 (2024)","venue":null,"work_id":"08fb03f5-1966-41bc-b2db-b203998dc08d","year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.225798Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:63573f54e2bd4f6fdd830981fe8fe3d0aa7b03f734ce5ebbce9fda60b26219f9","observation_id":"7598a37a-d303-4a7a-b95d-38b2f95001f9","resolution":{"observed_at":"2026-08-15T20:26:59.420022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:59.396296Z","title":null,"venue":null,"work_id":"b3ab979b-e1a1-4881-8d69-63d0cce2e7fd","year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.231910Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:ea0093e5f617bf657b7280436111af44bf21526e0143f4fb3f5f12b79d5b3245","observation_id":"1a45b6d6-9c64-4ef2-be54-7642c52af2ef","resolution":{"observed_at":"2026-08-15T20:26:59.401571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-14T06:07:59.988146Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-15T20:26:58.237599Z","title":"arXiv preprint arXiv:2504.06256 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.237599Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:7309a26a3477c8eb33be83cb9ee365c8d9858d2a0b6892290fe36ea3d9aa1cd7","observation_id":"291b28c4-8111-430b-9d8c-04cdec535f42","resolution":{"observed_at":"2026-08-15T20:26:58.237599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:58.243052Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.243052Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:5a20353c9c99c3b309fbd8380859a85e682c18efa1eb6e18a6d9fbc1630edc6c","observation_id":"85580cca-6308-4b8d-8487-64a66c2ff527","resolution":{"observed_at":"2026-08-15T20:26:58.243052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-15T20:26:58.249057Z","title":"arXiv preprint arXiv:2307.01952 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.249057Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:e5d3ca638fdb3d36aefcf07f230507abd20dd7cf14b65653741f3ddfbf64afa0","observation_id":"919c26c5-2940-41b1-b90f-853ae5be2a05","resolution":{"observed_at":"2026-08-15T20:26:58.249057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14544","last_updated":"2024-06-20T17:54:03Z","snapshot_observed_at":"2026-08-16T13:41:00.258560Z","submitted_at":"2024-06-20T17:54:03Z","title":"Prism: A Framework for Decoupling and Assessing the Capabilities of VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14544","snapshot_observed_at":"2026-08-15T20:26:58.255579Z","title":"arXiv preprint arXiv:2406.14544 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.255579Z"},"links":{"cited_paper":"/paper/2406.14544","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:77dc8c545b3a6063bfde6c6f07c47489dc76e1b34299161fe97a70e22ec6b870","observation_id":"c2050e8c-61c5-498d-b050-32f0d785b733","resolution":{"observed_at":"2026-08-15T20:26:58.255579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-08-15T18:07:41.591747Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-15T20:26:58.261282Z","title":"arXiv preprint arXiv:2412.03069 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.261282Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:cf47aff11cb54c55f462948da3fa00444599b1e24dff8c54a7b92d742a207f9f","observation_id":"ec67038c-8d8a-4cdd-b29e-5fc2732a4d94","resolution":{"observed_at":"2026-08-15T20:26:58.261282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:58.267389Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.267389Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:633001bb0c1875fc94e969d2798294828ba527eac96ded372a7b2f31bd46ca57","observation_id":"28a7daf4-7488-4264-a553-191935772155","resolution":{"observed_at":"2026-08-15T20:26:58.267389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:59.355450Z","title":"URL https://laion","venue":null,"work_id":"306d7cb2-20a8-4937-ada0-9951db3318a7","year":2022},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.272917Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:c4e42d7b7c6b79087d77f274647dac901bc8b608ab4c1c5c88bbb8fb15c67f88","observation_id":"fd21ddc3-1885-4e10-86b5-078be8500a1c","resolution":{"observed_at":"2026-08-15T20:26:59.361428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T20:26:58.278116Z","title":"arXiv preprint arXiv:2402.03300 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.278116Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:163ff4ebcefd24de159f8f94172c9deb634e90179044f2083680a206f4b41987","observation_id":"dc57ee99-1fd9-474c-8474-4f5352a5cc1e","resolution":{"observed_at":"2026-08-15T20:26:58.278116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:59.333532Z","title":null,"venue":null,"work_id":"a9387447-1ff5-489e-8aa7-0fe3ac437750","year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.283274Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:50ed56150454090df3f9c98c42eb7fa164451c14a2fdf43edaee91296903cd27","observation_id":"201000fc-ad77-4f4e-bc67-e3e3d979dec3","resolution":{"observed_at":"2026-08-15T20:26:59.340085Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:58.288057Z","title":"Advances in Neural Information Processing Systems36(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.288057Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:328397c2283e95995be7f231b0ed162f07173c8401eb6d8656db5b3d6ba23cd9","observation_id":"3c262794-8a07-4f9e-bede-c27c41c66ddf","resolution":{"observed_at":"2026-08-15T20:26:58.288057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-15T20:26:58.292902Z","title":"arXiv preprint arXiv:2406.06525 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.292902Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:287381e282a6f84622876ac533be355468a53228c96f75ee93f7bb0d52ffb081","observation_id":"4c803fed-c3c5-4f6d-8871-30da9ed25ac7","resolution":{"observed_at":"2026-08-15T20:26:58.292902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:58.298120Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.298120Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:01812a0413e5d2c3e9ec7b52db7952d7ec23c2f52a8cb4ae64c514d18c7fb0e3","observation_id":"e4632963-3123-4104-b269-d512bd4d163d","resolution":{"observed_at":"2026-08-15T20:26:58.298120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-15T20:26:58.303151Z","title":"arXiv preprint arXiv:2307.05222 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.303151Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:48bc5eef786bfa0e0673af59c53609d08a235bdf6a4f5f8acc7c730bc6921ccc","observation_id":"98a15ab1-62d7-4d53-9d89-e417288b8476","resolution":{"observed_at":"2026-08-15T20:26:58.303151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-15T20:26:58.308208Z","title":"arXiv preprint arXiv:2405.09818 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.308208Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:8cff28397ccb67c797ecfd4a3b6005db970c625e4170212d4bed61e13f955074","observation_id":"c29421bb-db06-4785-8940-54aa1b3a4209","resolution":{"observed_at":"2026-08-15T20:26:58.308208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:59.283295Z","title":"https://qwenlm.github.io/blog/qwen3/ (2025)","venue":null,"work_id":"6661c7f3-54b9-436d-b21a-cc817b90ba5f","year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.313105Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:6769b667a569865898c41ca479ec55dbe1558902faf19b577ace9aecc782df71","observation_id":"66b03bf8-fcd7-4704-bded-6c384a40c4e6","resolution":{"observed_at":"2026-08-15T20:26:59.291607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-17T07:24:03.168446Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-15T20:26:58.318304Z","title":"arXiv preprint arXiv:2412.14164 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.318304Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:d70913a3621b5f7580faf1d646e5e1e17d8654e331f86897886ba870fa4cd101","observation_id":"24f5c3f4-324c-4a48-9a70-8ebbefc79636","resolution":{"observed_at":"2026-08-15T20:26:58.318304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11455","last_updated":"2025-04-15T17:59:46Z","snapshot_observed_at":"2026-08-16T12:40:45.550358Z","submitted_at":"2025-04-15T17:59:46Z","title":"SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11455","snapshot_observed_at":"2026-08-15T20:26:58.325121Z","title":"arXiv preprint arXiv:2504.11455 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.325121Z"},"links":{"cited_paper":"/paper/2504.11455","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:5549adad4d555f7df2b8ee01e76a70e0db5a2ea7cb65e1ece9ea8cdf6b66bb63","observation_id":"a73daabc-cea4-4e13-a09e-18dec93b933a","resolution":{"observed_at":"2026-08-15T20:26:58.325121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-15T20:26:58.330544Z","title":"arXiv preprint arXiv:2409.18869 (2024) 12","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.330544Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:e8ddc747ac020aac3872727fb4ac6528e72a755c9846f2d12908479c3507a3bb","observation_id":"3230d9c1-e31f-46e9-b892-1fe14743546a","resolution":{"observed_at":"2026-08-15T20:26:58.330544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-15T20:26:58.336002Z","title":"arXiv preprint arXiv:2203.11171 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.336002Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:e05129747b0134ca2a1e5a174a3ae2c8dac1580e9db2af5c5fade172efac34b9","observation_id":"c4351010-997d-4a3b-badc-15655ea7642b","resolution":{"observed_at":"2026-08-15T20:26:58.336002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:58.341793Z","title":"Advances in neural information processing systems35, 24824–24837 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.341793Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:4045c00939ad2232c8a4ece303e36fad777af18525482c2c55c54d04f2235175","observation_id":"5335c9a1-029e-479f-bd32-a2e70ac05448","resolution":{"observed_at":"2026-08-15T20:26:58.341793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-15T20:26:58.349765Z","title":"arXiv preprint arXiv:2410.13848 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.349765Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:621fce1e6cdcebad6b3146d6162d088da6120318bc9f0df0d8542d9e0748b5db","observation_id":"8fd01c75-0378-4401-9204-80ee2baefb7c","resolution":{"observed_at":"2026-08-15T20:26:58.349765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-08-16T13:17:46.268142Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-08-15T20:26:58.355229Z","title":"arXiv preprint arXiv:2409.11340 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.355229Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:f2398591d7dc6912746b7324ce8bb2c9e5057932fdecc9c1e4b7dd8d41639cbb","observation_id":"be61ba36-fb07-4958-b08c-b7afd65ebeba","resolution":{"observed_at":"2026-08-15T20:26:58.355229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:58.361913Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.361913Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:a822d6a56ab50026a4b0da823c6f7039d8dd13fb476f93e958719d8ad2628d21","observation_id":"53886b6d-17f0-4ff6-9054-18d186fb1d29","resolution":{"observed_at":"2026-08-15T20:26:58.361913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:58.367010Z","title":"Advances in Neural Information Processing Systems37, 75329–75354 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.367010Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:17c778367e112a8b37acacd14d6bb1ffacfc0447b2731f83b214cf343d0c54f8","observation_id":"ebd3e111-3b5e-4f16-a112-97f3ec83ebfa","resolution":{"observed_at":"2026-08-15T20:26:58.367010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18427","last_updated":"2025-05-17T13:26:31Z","snapshot_observed_at":"2026-08-13T17:55:42.231540Z","submitted_at":"2025-01-30T15:31:48Z","title":"SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18427","snapshot_observed_at":"2026-08-15T20:26:58.372378Z","title":"arXiv preprint arXiv:2501.18427 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.372378Z"},"links":{"cited_paper":"/paper/2501.18427","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:9bfe9bc94f6cea9a8aa52d82e30c4adee46fd4be552b9f88bda9016beef2a843","observation_id":"1e8245d0-d674-457d-bc56-822780fdfde5","resolution":{"observed_at":"2026-08-15T20:26:58.372378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-15T20:26:58.378298Z","title":"arXiv preprint arXiv:2408.12528 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.378298Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:af84caeea87723eb771afe11cc2b941978b6ed08640c735134b0473e3f9b15b6","observation_id":"3b46e205-a7f2-4b77-bdad-2522772c0a0f","resolution":{"observed_at":"2026-08-15T20:26:58.378298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-15T17:00:20.282987Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-15T20:26:58.383514Z","title":"arXiv preprint arXiv:2411.10440 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.383514Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:618deb44ecdfe52f9f85824c6c5cc0ec7105eabfc183d2bdf82225086c05b8e5","observation_id":"0d036f42-8e5b-4d3f-914f-31e1b6e806bf","resolution":{"observed_at":"2026-08-15T20:26:58.383514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:59.212237Z","title":"In: Forty-first International Conference on Machine Learning (2024)","venue":null,"work_id":"dfdea111-d44e-4cc6-a783-74b2cd5e92f3","year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.389387Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:5e5cf68d1b47d28716d50abbd9edfd5f222a75ba5201a05e32cc3cfdbfa847a2","observation_id":"caa0872c-e1fe-4ea6-a846-d49e2085b19a","resolution":{"observed_at":"2026-08-15T20:26:59.222106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-08-17T03:48:18.599994Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-15T20:26:58.394455Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.394455Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:9fcb6a54c9eb90ba85ab94408b09276f0f12915ad3dafb2fa78556b677f40602","observation_id":"f0d08762-d7eb-44f3-9d89-59bb95314e85","resolution":{"observed_at":"2026-08-15T20:26:58.394455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:26:58.399332Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.399332Z"},"links":{"citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:9f1aa16f1df4596946750e7d8de37b9450eff1a4b1070b715ff010588f244060","observation_id":"343a32e8-aecf-439f-acaa-75b61d7c7461","resolution":{"observed_at":"2026-08-15T20:26:58.399332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-15T20:26:58.404285Z","title":"arXiv preprint arXiv:2408.11039 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.404285Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:3f77e82cf8da819ce00ecc5ddbbcb8563242262df1ad71898567001b3f387e16","observation_id":"2da049e6-d79a-4250-93a2-0ed83facdd20","resolution":{"observed_at":"2026-08-15T20:26:58.404285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-08-14T19:11:11.139675Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-15T20:26:58.409542Z","title":"aha moment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.409542Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:39d4f3f6bdab2bdb555e5c2d3b1352ab61cea61a4dadae7b90c1accd41855be2","observation_id":"aafa572c-8539-4cdd-bbf2-ea8757a1f41e","resolution":{"observed_at":"2026-08-15T20:26:58.409542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T23:44:11.890345Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 10 inbound Pith citation observations for arXiv:2505.13031."}