{"as_of":"2026-08-10T12:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d702b69f16cc8caeaf4cc49c059cde63e015811eb7209e47d0311ce290d7965","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:02:55.925858Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:07:21.383338Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:27:15.771664Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20256","snapshot_observed_at":"2026-08-05T12:07:21.383338Z","title":"Omni-r1: Reinforcement learning for om- nimodal reasoning via two-system collaboration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01939","last_updated":"2025-09-02T04:20:12Z","snapshot_observed_at":"2026-08-07T18:39:10.295579Z","submitted_at":"2025-09-02T04:20:12Z","title":"Group Relative Policy Optimization for Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T12:07:21.383338Z"},"links":{"cited_paper":"/paper/2505.20256","citing_paper":"/paper/2509.01939"},"observation_digest":"sha256:f74eee30b601ad6858976ed878d0a494d2070bb16d3799998c2623c135470485","observation_id":"748bcc57-ef43-4c6c-874a-623cafbcc7f9","resolution":{"observed_at":"2026-08-05T12:07:21.383338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"cited_work":{"arxiv_id":"2505.20256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20256","snapshot_observed_at":"2026-07-02T17:27:15.771664Z","title":"Omni-r1: Reinforcement learning for omnimodal reasoning via two-system collaboration","venue":null,"work_id":"a2e58306-197a-4163-90e2-17af266cba24","year":2025},"citing_paper":{"arxiv_id":"2510.15148","last_updated":"2026-04-04T21:55:10Z","snapshot_observed_at":"2026-07-06T22:32:51.756468Z","submitted_at":"2025-10-16T21:10:22Z","title":"XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T05:45:07.700571Z"},"links":{"cited_paper":"/paper/2505.20256","citing_paper":"/paper/2510.15148"},"observation_digest":"sha256:8e64628023740d81af18c02ef3d9c37f48a6161ee1a2d1cca86e0bda3c2989d7","observation_id":"11fa81bf-7cdf-4185-802d-a848fa6ccfb4","resolution":{"observed_at":"2026-05-18T05:45:56.128382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"cited_work":{"arxiv_id":"2505.20256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20256","snapshot_observed_at":"2026-07-02T17:27:15.771664Z","title":"Omni-r1: Reinforcement learning for omnimodal reasoning via two-system collaboration","venue":null,"work_id":"a2e58306-197a-4163-90e2-17af266cba24","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2505.20256","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:7c290be29c79563b81edbab85ec3595d93cda7495d86adb35112009e1a7111fc","observation_id":"9a349702-83c9-405d-ae4c-4abb8a12968e","resolution":{"observed_at":"2026-05-22T12:31:32.120343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"cited_work":{"arxiv_id":"2505.20256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20256","snapshot_observed_at":"2026-07-02T17:27:15.771664Z","title":"Omni-r1: Reinforcement learning for omnimodal reasoning via two-system collaboration","venue":null,"work_id":"a2e58306-197a-4163-90e2-17af266cba24","year":2025},"citing_paper":{"arxiv_id":"2601.09536","last_updated":"2026-04-18T07:44:28Z","snapshot_observed_at":"2026-07-06T22:41:43.594456Z","submitted_at":"2026-01-14T14:57:33Z","title":"Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T14:37:05.402850Z"},"links":{"cited_paper":"/paper/2505.20256","citing_paper":"/paper/2601.09536"},"observation_digest":"sha256:8cc3414fdbe5eebe9e98f228d962b3fa92b6ea049c0351b6578a594526f80e9a","observation_id":"60a8a706-ac62-4312-9138-576e90d3bfca","resolution":{"observed_at":"2026-05-16T14:37:59.982181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"cited_work":{"arxiv_id":"2505.20256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20256","snapshot_observed_at":"2026-07-02T17:27:15.771664Z","title":"Omni-r1: Reinforcement learning for omnimodal reasoning via two-system collaboration","venue":null,"work_id":"a2e58306-197a-4163-90e2-17af266cba24","year":2025},"citing_paper":{"arxiv_id":"2604.08209","last_updated":"2026-04-09T13:09:40Z","snapshot_observed_at":"2026-07-06T22:57:22.475588Z","submitted_at":"2026-04-09T13:09:40Z","title":"OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T17:45:51.528645Z"},"links":{"cited_paper":"/paper/2505.20256","citing_paper":"/paper/2604.08209"},"observation_digest":"sha256:5aa07f11a456a609d532f81f066c2f353a1d5a034b121bff8f3f216a68d94da4","observation_id":"a35bda6a-7128-40f8-b307-a518e00bcfc2","resolution":{"observed_at":"2026-05-11T06:11:01.973351Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"cited_work":{"arxiv_id":"2505.20256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20256","snapshot_observed_at":"2026-07-02T17:27:15.771664Z","title":"Omni-r1: Reinforcement learning for omnimodal reasoning via two-system collaboration","venue":null,"work_id":"a2e58306-197a-4163-90e2-17af266cba24","year":2025},"citing_paper":{"arxiv_id":"2604.11244","last_updated":"2026-04-15T07:55:01Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T09:50:36Z","title":"Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T15:07:45.595260Z"},"links":{"cited_paper":"/paper/2505.20256","citing_paper":"/paper/2604.11244"},"observation_digest":"sha256:41adf900e8286619d9c57b167b44cd648bf0ac60402f65122f0ffa7de976f310","observation_id":"5cd62825-00f7-443b-b17b-2f24b32fc7a8","resolution":{"observed_at":"2026-05-11T11:11:03.827672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"cited_work":{"arxiv_id":"2505.20256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20256","snapshot_observed_at":"2026-07-02T17:27:15.771664Z","title":"Omni-r1: Reinforcement learning for omnimodal reasoning via two-system collaboration","venue":null,"work_id":"a2e58306-197a-4163-90e2-17af266cba24","year":2025},"citing_paper":{"arxiv_id":"2604.12527","last_updated":"2026-07-03T08:49:19Z","snapshot_observed_at":"2026-07-12T21:18:44.451500Z","submitted_at":"2026-04-14T10:00:39Z","title":"Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T14:10:03.707886Z"},"links":{"cited_paper":"/paper/2505.20256","citing_paper":"/paper/2604.12527"},"observation_digest":"sha256:8f968602ebbd7a97d7e1f7fbd8a94a04279ce9fa95cc535513da631f20d04afe","observation_id":"3eb7c43c-ccbd-4e9a-a055-c0581c6ba1b4","resolution":{"observed_at":"2026-05-10T14:10:28.298818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20256","snapshot_observed_at":"2026-07-12T21:18:46.566338Z","title":"Omni-r1: Reinforcement learning for om- nimodal reasoning via two-system collaboration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.12527","last_updated":"2026-07-03T08:49:19Z","snapshot_observed_at":"2026-07-12T21:18:44.451500Z","submitted_at":"2026-04-14T10:00:39Z","title":"Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T21:18:46.566338Z"},"links":{"cited_paper":"/paper/2505.20256","citing_paper":"/paper/2604.12527"},"observation_digest":"sha256:54f94283755eabea32c0649fdbc7d18fb038f971db6663240c454fd44bdaea84","observation_id":"6eb1a9ba-ff0e-40fe-a774-7737a268bd6a","resolution":{"observed_at":"2026-07-12T21:18:46.566338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"cited_work":{"arxiv_id":"2505.20256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20256","snapshot_observed_at":"2026-07-02T17:27:15.771664Z","title":"Omni-r1: Reinforcement learning for omnimodal reasoning via two-system collaboration","venue":null,"work_id":"a2e58306-197a-4163-90e2-17af266cba24","year":2025},"citing_paper":{"arxiv_id":"2604.14520","last_updated":"2026-04-16T01:21:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T01:21:14Z","title":"Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T12:05:54.551728Z"},"links":{"cited_paper":"/paper/2505.20256","citing_paper":"/paper/2604.14520"},"observation_digest":"sha256:c317cebd68e6dce2a9a38fa3401538788ea8056263b9936a6fc70a90f04a2a8a","observation_id":"33213efd-ece5-4758-826a-c2693ae4e7c5","resolution":{"observed_at":"2026-05-10T12:10:22.082628Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"cited_work":{"arxiv_id":"2505.20256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20256","snapshot_observed_at":"2026-07-02T17:27:15.771664Z","title":"Omni-r1: Reinforcement learning for omnimodal reasoning via two-system collaboration","venue":null,"work_id":"a2e58306-197a-4163-90e2-17af266cba24","year":2025},"citing_paper":{"arxiv_id":"2604.16617","last_updated":"2026-04-17T18:13:27Z","snapshot_observed_at":"2026-08-02T22:28:35.019925Z","submitted_at":"2026-04-17T18:13:27Z","title":"AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T08:02:53.574120Z"},"links":{"cited_paper":"/paper/2505.20256","citing_paper":"/paper/2604.16617"},"observation_digest":"sha256:75542135865e6cd7d9f6bcf03452afcdc52917af8b5c710424ea42ff92dbb25e","observation_id":"6baa4af0-3229-4b99-b6c1-dfea506983bf","resolution":{"observed_at":"2026-05-10T09:18:32.211166Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"cited_work":{"arxiv_id":"2505.20256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20256","snapshot_observed_at":"2026-07-02T17:27:15.771664Z","title":"Omni-r1: Reinforcement learning for omnimodal reasoning via two-system collaboration","venue":null,"work_id":"a2e58306-197a-4163-90e2-17af266cba24","year":2025},"citing_paper":{"arxiv_id":"2605.07154","last_updated":"2026-05-08T02:40:34Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T02:40:34Z","title":"PRIMED: Adaptive Modality Suppression for Referring Audio-Visual Segmentation via Biased Competition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T02:30:44.486435Z"},"links":{"cited_paper":"/paper/2505.20256","citing_paper":"/paper/2605.07154"},"observation_digest":"sha256:496a49f3a294343eae82652c61e410e806fa7a9465855d1e11c0d0aede98ecf0","observation_id":"cf8a1670-c68e-4524-ad51-1587028d1389","resolution":{"observed_at":"2026-05-11T02:30:53.325802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"cited_work":{"arxiv_id":"2505.20256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20256","snapshot_observed_at":"2026-07-02T17:27:15.771664Z","title":"Omni-r1: Reinforcement learning for omnimodal reasoning via two-system collaboration","venue":null,"work_id":"a2e58306-197a-4163-90e2-17af266cba24","year":2025},"citing_paper":{"arxiv_id":"2605.07334","last_updated":"2026-05-08T06:39:53Z","snapshot_observed_at":"2026-07-30T14:06:30.177866Z","submitted_at":"2026-05-08T06:39:53Z","title":"RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T01:16:25.031349Z"},"links":{"cited_paper":"/paper/2505.20256","citing_paper":"/paper/2605.07334"},"observation_digest":"sha256:b77ba4deed1f905e08be8596908b231cfb48598adb4031a760e07cdc064c2953","observation_id":"e46a2ae7-4b41-41ec-9c82-fcdb79ddfe19","resolution":{"observed_at":"2026-05-11T04:30:59.904231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"cited_work":{"arxiv_id":"2505.20256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20256","snapshot_observed_at":"2026-07-02T17:27:15.771664Z","title":"Omni-r1: Reinforcement learning for omnimodal reasoning via two-system collaboration","venue":null,"work_id":"a2e58306-197a-4163-90e2-17af266cba24","year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2505.20256","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:8a04b66231afedc629f22b5354c1890d371eb81a34f30d49612f07f404488f33","observation_id":"59631231-82f1-48ef-91b3-68a6c3106ccb","resolution":{"observed_at":"2026-07-02T02:36:27.106597Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"cited_work":{"arxiv_id":"2505.20256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20256","snapshot_observed_at":"2026-07-02T17:27:15.771664Z","title":"Omni-r1: Reinforcement learning for omnimodal reasoning via two-system collaboration","venue":null,"work_id":"a2e58306-197a-4163-90e2-17af266cba24","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":202,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2505.20256","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:f9031aea598a763f0f1cbcebd81c5c3d8f381c96e7e6332a0d8f42e21bdab07d","observation_id":"6c937d94-f391-4895-86bf-b614ce2e5c02","resolution":{"observed_at":"2026-07-02T17:27:15.773107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20256/citation-record","integrity":"/paper/2505.20256/integrity","json":"/paper/2505.20256/citation-record.json","paper":"/paper/2505.20256"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:50.909522Z","title":"Baichuan-omni-1.5 technical report.arXiv preprint arXiv:2501.15368, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.909522Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:3af4cd8e3872d6a5cd39c46febd16bf3cfaafabc434af18568d085a0c6284775","observation_id":"2232d5e1-3447-49bc-a637-195515e6dddc","resolution":{"observed_at":"2026-08-07T14:02:50.909522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:02:51.005221Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.005221Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:c9046f09c9a825923979a25ae04e32da72773996130d0213b63a0fa28880c865","observation_id":"d14e2908-41ad-4ccf-8550-d93ac69167d0","resolution":{"observed_at":"2026-08-07T14:02:51.005221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:59.886402Z","title":"Attention-based multimodal fusion for video description","venue":null,"work_id":"34329a71-fc5d-4a04-9308-09df8f15ff8e","year":2017},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.127713Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:a686aa261ec6bef046cf39735e5fb0cf972a7fadca10a20f0dbe4c3796384442","observation_id":"de29e52b-f9c2-48b2-9b1b-4832bbcb07e3","resolution":{"observed_at":"2026-08-07T14:03:00.035632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:59.705278Z","title":"Merlot reserve: Neural script knowledge through vision and language and sound","venue":null,"work_id":"185943bb-cfc0-4737-a34a-c6639678d02e","year":2022},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.236879Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:dfa5688c94652fe97090105635b5a012c9f984d2cd1f105c0c9a6cb005b5bb3b","observation_id":"db73eb7c-7f3e-4be0-910c-c0d9f3f905d4","resolution":{"observed_at":"2026-08-07T14:02:59.778055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T14:02:51.365763Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.365763Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:3ba4bdaa04cb3d1b78db78831cc325a90786dba81f2339a5f8be570b68b506d4","observation_id":"1a800756-ad6a-4554-a341-e925a6bc26bc","resolution":{"observed_at":"2026-08-07T14:02:51.365763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T14:02:51.438063Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.438063Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:46cdfc54dde2b98225527c1e8e84d49f7507427c468983b158e366c97fc21509","observation_id":"5a787639-7038-44a8-9486-9a03bd435645","resolution":{"observed_at":"2026-08-07T14:02:51.438063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18938","last_updated":"2024-12-03T03:56:52Z","snapshot_observed_at":"2026-07-06T19:23:33.343982Z","submitted_at":"2024-09-27T17:38:36Z","title":"From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18938","snapshot_observed_at":"2026-08-07T14:02:51.602440Z","title":"From seconds to hours: Reviewing multimodal large language models on comprehensive long video understanding.arXiv preprint arXiv:2409.18938, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.602440Z"},"links":{"cited_paper":"/paper/2409.18938","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:9f1c464124ba0cb04174af4c5ecc9a9d33ca18661768e13d18a0661dd93f9e83","observation_id":"be76c2b1-c408-4058-bf43-522ab05a4069","resolution":{"observed_at":"2026-08-07T14:02:51.602440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:51.665984Z","title":"Mavors: Multi-granularity video representation for multimodal large language model.arXiv preprint arXiv:2504.10068, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.665984Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:d606728714e9fd3b9182a7a30a8f3610ada40f626f51eef41e5ad1e9e1901c3e","observation_id":"2dba246a-4fb9-4b09-9aae-66b5f621b3a7","resolution":{"observed_at":"2026-08-07T14:02:51.665984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:59.559445Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"3b569a0e-5a2e-4440-b9fa-a50f9cdc3688","year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.756900Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:0e303ec11c064ab4b5efd8b54b0d129692c7df8af8a2da30b4bf8fc447a81010","observation_id":"ec614a37-190e-4dd2-9939-6843c541cbfd","resolution":{"observed_at":"2026-08-07T14:02:59.626240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:02:51.849583Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.849583Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:c4fcd4891509967f50fff48b5990c1565298349efa39f6fe920ae761d1866e9c","observation_id":"8b47e923-4132-4fb2-b4e6-cd716d3c4cb8","resolution":{"observed_at":"2026-08-07T14:02:51.849583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-07T14:02:51.955495Z","title":"Kosmos-2: Grounding multimodal large language models to the world.arXiv preprint arXiv:2306.14824, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.955495Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:7e4a8e61195a81490cd8d8d18954d1c8771f0619569bb011355aa4cda54628bb","observation_id":"da2c69d7-9b43-48ea-8f86-2b0e4b4ecd34","resolution":{"observed_at":"2026-08-07T14:02:51.955495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-07T14:02:52.067992Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding.arXiv preprint arXiv:2306.17107, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.067992Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:2bcde08954a9273d706499d0237d2a4cda37fefc709aa5307354fa8f0070ba24","observation_id":"89728534-4ffa-413d-875c-af011ef21c29","resolution":{"observed_at":"2026-08-07T14:02:52.067992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-09T20:40:14.205704Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-07T14:02:52.167671Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document.arXiv preprint arXiv:2403.04473, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.167671Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:dcc957043e5376e042576c834cc1342f05a7d2e7c2d58870b9a7d26b9570be93","observation_id":"ab764237-0230-4fb1-8c10-aa1c07c08872","resolution":{"observed_at":"2026-08-07T14:02:52.167671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:59.389535Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":"5a96f9c9-d968-4ce3-89cf-4c2a227375d2","year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.272410Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:09fb8c2eab8d9905fa7347146770879eb9a781513d11d411e1005f69d603f260","observation_id":"8e81f7b7-2473-478f-ba07-1d29a9a0dee1","resolution":{"observed_at":"2026-08-07T14:02:59.476621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:59.225833Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks","venue":null,"work_id":"5e055e89-5fa7-4ef8-beb4-9bfb9eb8e7ec","year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.368454Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:472908cfc49b56e06e8ebfe8c2ab2ae645520a5079f7822c7b76636e225b1f7d","observation_id":"b90be1db-5ac2-4685-bb08-193e845dc734","resolution":{"observed_at":"2026-08-07T14:02:59.274294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:02:52.459678Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.459678Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:02c6e327308e102807b51da3556202af1373eb07d71ceef36c446d3798333767","observation_id":"e806b0ba-fb70-439e-bafa-89354ea7f852","resolution":{"observed_at":"2026-08-07T14:02:52.459678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:02:52.541895Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.541895Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:2789edcea7c47fde592413834296f016abaab4fbe96385c79f26931c652e7e4a","observation_id":"1768ab9d-764b-4ddd-92f2-d163ff7de1c4","resolution":{"observed_at":"2026-08-07T14:02:52.541895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:59.057093Z","title":null,"venue":null,"work_id":"f9143d94-cfc4-4a18-869a-59dc238aa2e6","year":2022},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.652896Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:3655120092f58bb0ae33ee8e73cb104f3c5b7f09a2c68aa4d4ea9d892fcd5241","observation_id":"0c77d780-6a4c-4f63-8797-8eaa616d254f","resolution":{"observed_at":"2026-08-07T14:02:59.154520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11895","last_updated":"2024-07-16T16:24:31Z","snapshot_observed_at":"2026-07-06T18:47:17.428629Z","submitted_at":"2024-07-16T16:24:31Z","title":"OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11895","snapshot_observed_at":"2026-08-07T14:02:52.741949Z","title":"Omnibind: Large-scale omni multimodal representation via binding spaces.arXiv preprint arXiv:2407.11895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.741949Z"},"links":{"cited_paper":"/paper/2407.11895","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:d7aa1b756c62b536ab01e91c5f14015aa75bdad49b4203aa28f66e141573c784","observation_id":"4127edd4-722e-45d1-831c-5edaeb2445eb","resolution":{"observed_at":"2026-08-07T14:02:52.741949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:58.926544Z","title":"Ref- avs: Refer and segment objects in audio-visual scenes","venue":null,"work_id":"97160f0e-5cbd-4b01-9991-8d6976d5990e","year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.854703Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:6fe24dde0807a1d2d8a4325e01a68cff4012118ccb6111bbcf1af30c509c0286","observation_id":"4ea6870f-df15-4826-9250-2e6d29f1f584","resolution":{"observed_at":"2026-08-07T14:02:58.977483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11325","last_updated":"2024-07-16T02:29:29Z","snapshot_observed_at":"2026-07-06T18:46:56.695142Z","submitted_at":"2024-07-16T02:29:29Z","title":"VISA: Reasoning Video Object Segmentation via Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11325","snapshot_observed_at":"2026-08-07T14:02:52.905262Z","title":"Visa: Reasoning video object segmentation via large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.905262Z"},"links":{"cited_paper":"/paper/2407.11325","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:d07dae6df5f11f4b85f07d5e142a1be5b0e79863738e51921309806eccedca70","observation_id":"7dc7196d-1d7d-4a5b-9b90-e1fa8f024dc9","resolution":{"observed_at":"2026-08-07T14:02:52.905262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:02:53.016804Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.016804Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:9c857eb94b54f98ef8f12375d413f91db689b12e28fc620b6b62828a0b942972","observation_id":"0836b924-e8b9-452e-96a7-5763e205d746","resolution":{"observed_at":"2026-08-07T14:02:53.016804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T14:02:53.127369Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.127369Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:a55023e98a96d439bf3c836fdc49e9edfb872c241d5199cd0abc71e1eee36f53","observation_id":"56cf3a5c-718e-402e-a6fa-5b117e9945c1","resolution":{"observed_at":"2026-08-07T14:02:53.127369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T14:02:53.175517Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.175517Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:eca3e4b389a3d175277b6c8e33f4a7d96b1251682e53df7e35189565572a8532","observation_id":"37f867b5-ad9a-4d51-9c38-7b886fb81541","resolution":{"observed_at":"2026-08-07T14:02:53.175517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:02:53.295895Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.295895Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:dd4bec07a31a61748c71703233ba85eef5f4112f34b57add6e9e02e2475de675","observation_id":"fb06e6fa-3c67-441d-a998-be2940b55e26","resolution":{"observed_at":"2026-08-07T14:02:53.295895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:02:53.381768Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.381768Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:f6b0131cc8eca618493d5bd5034fd68f9d0394ab8e67cdb023edc53e6d991041","observation_id":"373e72bc-1f8a-40de-bfaa-f65fa07922f0","resolution":{"observed_at":"2026-08-07T14:02:53.381768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:58.766913Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":"76e0049a-9fc6-45bc-913b-1e38bba34fc6","year":2023},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.464889Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:618cd426e14c33e7f9df08c2de7b2e5865f92ef7666db12f966000d2c7d1d3bb","observation_id":"e126d7be-81b3-4c64-988b-4074a4487086","resolution":{"observed_at":"2026-08-07T14:02:58.820469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:53.519220Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.519220Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:cb68e85cd3e7a94a6af45da2bc5ff95e5359e6b35f53a9d57f9cfacbe9b93f21","observation_id":"811d0ee5-5e8d-4291-b3e4-a069be9de93d","resolution":{"observed_at":"2026-08-07T14:02:53.519220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:58.574478Z","title":"Deepseek-vl: Towards real-world vision-language understanding, 2024","venue":null,"work_id":"8977a0da-a4aa-404c-8968-646dcbfcb05e","year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.626176Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:896ffd4c659ac598cd7cb3cbdf03972639fa1190c6cca5957707fdf959e67345","observation_id":"8a7f098b-4c37-4905-9a09-dca496a1a4fd","resolution":{"observed_at":"2026-08-07T14:02:58.724157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-07T14:02:53.705119Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.705119Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:2ac625dc2fe09a68913ae37e4be7636a5c659e1eb2b5e5afa647099772107d27","observation_id":"0fb3a83b-ac11-422f-95b0-30d323ede06c","resolution":{"observed_at":"2026-08-07T14:02:53.705119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:58.369088Z","title":"Omnibench: Towards the future of universal omni-language models, 2024","venue":null,"work_id":"09d955c2-7147-46f5-bdad-0a9bed19dde5","year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.786386Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:c53d2b1a90ef17893c2850d1bf88ecbc2439061bd67c8b6167212d754937c25d","observation_id":"1596d63f-ea15-4435-9835-bba8ac980638","resolution":{"observed_at":"2026-08-07T14:02:58.455156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T14:02:53.893277Z","title":"Visual-rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.893277Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:676a0cb568545bd42a72bc2c9c16d7cfd9e1016361d465187e6004f8ef7f784d","observation_id":"7acc720e-527d-4dd3-ae3e-2dbdd88aae6c","resolution":{"observed_at":"2026-08-07T14:02:53.893277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T14:02:53.986036Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.986036Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:2178492d3a1f8299975701b0c5bc885b6cb8d79f1e3e078ec26bc52417393bf2","observation_id":"dc2370a3-20a0-475c-ab8b-8c05fdd5def9","resolution":{"observed_at":"2026-08-07T14:02:53.986036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-07T14:02:54.059626Z","title":"Video-r1: Reinforcing video reasoning in mllms.arXiv preprint arXiv:2503.21776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:54.059626Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:e97cf10825614c2e3fba9bfff89d563f51db45c89a420ba1b43a52f8068c8e40","observation_id":"ed74b537-c464-4e8c-ae1c-f4a2f2fb4fba","resolution":{"observed_at":"2026-08-07T14:02:54.059626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T14:02:54.164163Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning.arXiv preprint arXiv:2504.06958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:54.164163Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:010b218e499c505d63a4ec5363f6f64481d5c850209033c6a1986499be17a77e","observation_id":"5f7eead2-aa70-42dd-8e9d-189cd6d4bd3a","resolution":{"observed_at":"2026-08-07T14:02:54.164163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:58.229524Z","title":"R1-omni: Explainable omni-multimodal emotion recognition with reinforcement learning, 2025","venue":null,"work_id":"9a71a0b7-b02e-45ad-ad39-d36b12ecb173","year":2025},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:54.253030Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:98f851eeec85bcbd271c9e668030706dc16267e80709fd77929a729bbeeebebc","observation_id":"84479aa3-2f2e-43ac-82ad-7c4c856e9879","resolution":{"observed_at":"2026-08-07T14:02:58.301784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T14:02:54.312129Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:54.312129Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:a15cfc9eb8ac0117673663138b10ab9ad7cfaa8362fd67a85cc9ec851d6650b9","observation_id":"76ba6c11-fdad-4b64-8791-6417ff75765f","resolution":{"observed_at":"2026-08-07T14:02:54.312129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:58.116312Z","title":"End-to-end object detection with transformers","venue":null,"work_id":"afa76153-13a3-414a-9237-0b34af81805b","year":2020},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:54.373043Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:e710a3c637fe32c9b748bb9f218f2b82847fe5ae73c9c7b0ba3b9719e2cdb425","observation_id":"091839ed-40c2-4cb8-931b-5ad43caaca4f","resolution":{"observed_at":"2026-08-07T14:02:58.165672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:57.968405Z","title":"MeViS: A large-scale benchmark for video segmentation with motion expressions","venue":null,"work_id":"1b756a24-ae13-492c-b067-b2bdbe818eb2","year":2023},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:54.490953Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:b8caaf15ba7616bf73edcd4b9ffa17e031a792d4f3690b9e9d1ae2be9d653094","observation_id":"ee01d021-eb3e-42d2-a4e6-7f0ab97fa304","resolution":{"observed_at":"2026-08-07T14:02:58.046533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:57.737686Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"1804eacd-2f54-443e-a035-9010db8eed17","year":2016},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:54.574343Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:c634b0de91dff7c4f7a716c7bcfe5d8ad8b0b6663f7f57007a5d99423c8ef980","observation_id":"9a828aec-1762-4492-81f7-72aa9620e47a","resolution":{"observed_at":"2026-08-07T14:02:57.852661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-07T17:19:13.101842Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-08-07T14:02:54.636835Z","title":"Seg- zero: Reasoning-chain guided segmentation via cognitive reinforcement.arXiv preprint arXiv:2503.06520, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:54.636835Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:a4af0add1454881a9937a99e8cd3dcd75c7b0aa64c3e24533bdd2779be9ac8ed","observation_id":"2760fb1d-f276-4eb6-8b9e-6aae6a500311","resolution":{"observed_at":"2026-08-07T14:02:54.636835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:57.510847Z","title":"Avsbench: A pixel-level audio- visual segmentation benchmark","venue":null,"work_id":"11f4515f-6b97-40a3-8943-6949a8af7b44","year":null},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:54.754197Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:d5820b7d3d89d3767d77c8897b2f511530cda06c92e737842dca0a9c44d23f08","observation_id":"b1dfba77-6695-479a-82fd-bed20612b408","resolution":{"observed_at":"2026-08-07T14:02:57.620689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:57.354283Z","title":"Avsegformer: Audio-visual segmentation with transformer","venue":null,"work_id":"13493baf-f64b-4ece-9f49-e9b9f5b4d656","year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:54.861182Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:ed2187c3c94262618cb73aa4b639c4bd283928409655d953d1edf8b2e9077125","observation_id":"d024c242-252c-4501-ae1f-6bcb9173d017","resolution":{"observed_at":"2026-08-07T14:02:57.429546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:57.138675Z","title":"Prompting segmentation with sound is generalizable audio-visual source localizer","venue":null,"work_id":"3d3fb1c3-cd7a-446a-b187-edfa04125374","year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:54.935916Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:9c8871636cb3147b875e030a09157e610dba671222b250c9e6a039f6e4d9228e","observation_id":"2121f94a-ed7e-481f-ac14-118ba329eea8","resolution":{"observed_at":"2026-08-07T14:02:57.234971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:56.998278Z","title":"Language as queries for referring video object segmentation","venue":null,"work_id":"9f82fca6-45ef-4436-9c3a-52a9ba79db7e","year":2022},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:55.054466Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:4c8ddb190d527fc7c8c621ff7054e1ae6c4177bc785de2da90ef954d2f7df563","observation_id":"fff28671-19d9-4f53-95d3-f7cedab4b6f5","resolution":{"observed_at":"2026-08-07T14:02:57.080900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:56.836342Z","title":"Robust referring video object segmentation with cyclic structural consensus","venue":null,"work_id":"164db5b5-afe2-46eb-b300-e2ab03926497","year":2023},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:55.159388Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:424009ce46bd914adec754085c5238ae53d5d146994eaf1837d88422e2315721","observation_id":"b616ca86-1092-41be-9e2b-4c47089ceeb6","resolution":{"observed_at":"2026-08-07T14:02:56.912927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00066","last_updated":"2024-01-29T20:05:14Z","snapshot_observed_at":"2026-07-06T17:23:18.724263Z","submitted_at":"2024-01-29T20:05:14Z","title":"TrackGPT -- A generative pre-trained transformer for cross-domain entity trajectory forecasting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00066","snapshot_observed_at":"2026-08-07T14:02:55.274394Z","title":"Trackgpt–a generative pre-trained transformer for cross-domain entity trajectory forecasting.arXiv preprint arXiv:2402.00066, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:55.274394Z"},"links":{"cited_paper":"/paper/2402.00066","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:7b446a30d8fa99eb4e120e4a9304f94275bf410df0b324f8014102493a8d7bcd","observation_id":"28b03452-ecb1-438a-bf2a-f2a1a82b46a0","resolution":{"observed_at":"2026-08-07T14:02:55.274394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-08T01:58:42.644918Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-08-07T14:02:55.376208Z","title":"Sa2va: Marrying sam2 with llava for dense grounded understanding of images and videos.arXiv preprint arXiv:2501.04001, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:55.376208Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:56cf43bf36c2b6e0ccf81b85bd3ab2515801c6eadf50dc3ce467cced387af913","observation_id":"05bc131d-b4c1-4755-91d1-174dceae61f9","resolution":{"observed_at":"2026-08-07T14:02:55.376208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T14:02:55.437771Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:55.437771Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:cce8efd120705354e4992cfe9944f669fc9d89c7b94a18a67bfe89f341244449","observation_id":"ed5cd32a-4c1b-4cbd-b21c-9fe3843808f9","resolution":{"observed_at":"2026-08-07T14:02:55.437771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-08-10T11:57:00.228306Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-08-07T14:02:55.535106Z","title":"Kangaroo: A powerful video-language model supporting long-context video input.arXiv preprint arXiv:2408.15542, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:55.535106Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:fc57b648b03144ab7de031b0bda12e2c13b7e31cae542adc991651d64053714d","observation_id":"a3fcd63b-ceaa-46f9-bd7f-2fcd422481f8","resolution":{"observed_at":"2026-08-07T14:02:55.535106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-07T14:02:55.605882Z","title":"Vita-1.5: Towards gpt-4o level real-time vision and speech interaction.arXiv preprint arXiv:2501.01957, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:55.605882Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:5c5b70e1fc30f4cfc9b1d5b14cc3c2f25034c2758f0e8f158e9c2083704cbdef","observation_id":"41704680-dbff-4445-9e9d-9142addf6d12","resolution":{"observed_at":"2026-08-07T14:02:55.605882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T14:02:55.662704Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:55.662704Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:1563c9c8542505a63f6db8c85c9a9e2bb93cd21c2ee31babf81e33729f6a2f8d","observation_id":"54bdf31a-b38e-46dd-8339-8ec5817828e8","resolution":{"observed_at":"2026-08-07T14:02:55.662704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:55.721329Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:55.721329Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:47b03a64dd0cbc277d63b4b844e87edd9c013d8f3778cfbeadc493afdf8ec917","observation_id":"30c68b51-6c35-4cf8-b986-ded5388dec21","resolution":{"observed_at":"2026-08-07T14:02:55.721329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:56.680339Z","title":null,"venue":null,"work_id":"2fa92895-3f49-4458-af39-e9972e214434","year":2016},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:55.829573Z"},"links":{"citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:b81c992c937ccc4757e28dc17bdea18461888b20ef4f2c045940978b3b032f06","observation_id":"e8162af0-fae5-4271-94fb-4f446fa0a774","resolution":{"observed_at":"2026-08-07T14:02:56.762742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18325","last_updated":"2025-03-17T08:14:35Z","snapshot_observed_at":"2026-08-04T07:32:52.841771Z","submitted_at":"2024-10-23T23:36:06Z","title":"AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18325","snapshot_observed_at":"2026-08-07T14:02:55.925858Z","title":"Avhbench: A cross-modal hallucination benchmark for audio-visual large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:55.925858Z"},"links":{"cited_paper":"/paper/2410.18325","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:1a68f65254655b73e26e82ede966f0be57553c86c74e564dfa3c0d58e9254b76","observation_id":"ec44756a-9734-4793-b05a-a27563163f71","resolution":{"observed_at":"2026-08-07T14:02:55.925858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 14 inbound Pith citation observations for arXiv:2505.20256."}