{"as_of":"2026-08-18T22:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab1f3cbdd99013dabb3fe9601f3ade04f67ec06e556816a6013caf28c72264ca","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:37:50.854503Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:24:08.154904Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T18:13:44.857313Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24164","snapshot_observed_at":"2026-08-15T17:24:08.154904Z","title":"Mixed-r1: Unified reward perspective for reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.154904Z"},"links":{"cited_paper":"/paper/2505.24164","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:b0bd3afe6e06a410c49f4442d5ef7f7032746a690e2927c6539848f009b3e67d","observation_id":"d2cec0f4-2c7c-45ac-8c25-2662a84eb841","resolution":{"observed_at":"2026-08-15T17:24:08.154904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24164","snapshot_observed_at":"2026-08-03T11:13:16.940627Z","title":"Mixed-r1: Unified reward perspective for reasoning capa- bility in multimodal large language models.arXiv preprint arXiv:2505.24164, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07298","last_updated":"2026-06-21T08:39:33Z","snapshot_observed_at":"2026-08-08T14:41:26.174719Z","submitted_at":"2026-01-12T08:15:36Z","title":"Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T11:13:16.940627Z"},"links":{"cited_paper":"/paper/2505.24164","citing_paper":"/paper/2601.07298"},"observation_digest":"sha256:b01ec46ee46c61b0d3d7ff2c036333de47f6b5b667bb904e3a075712eb143c2e","observation_id":"47793b81-619c-4a58-94a6-a23602ca3b68","resolution":{"observed_at":"2026-08-03T11:13:16.940627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24164","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24164","snapshot_observed_at":"2026-08-10T18:13:44.857313Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","venue":"cs.CL","work_id":"533dbd2e-73c0-4397-9319-9314d0eafa0b","year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-15T05:53:27.648278Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.320002Z"},"links":{"cited_paper":"/paper/2505.24164","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:56d8397d151dd91c3675a6be996074f8c15f360d2f8d068ef3d31268af91849e","observation_id":"41f95256-3d3a-4c1f-a884-73c828d10848","resolution":{"observed_at":"2026-08-10T18:13:44.864443Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24164/citation-record","integrity":"/paper/2505.24164/integrity","json":"/paper/2505.24164/citation-record.json","paper":"/paper/2505.24164"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:37:42.783123Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:42.783123Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:73b63e1a5386b14b2a2a2fa565a6d1f0f3ccfffe1d5feb2ec8d7135da56e616b","observation_id":"a205b59b-d940-44ec-b20b-b1ce05113763","resolution":{"observed_at":"2026-08-07T12:37:42.783123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T12:37:42.873209Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:42.873209Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:9afb4f1eecf676950b28ebafe193c77bc8eb2ddf1db7b83b8453d57f567dd926","observation_id":"5b68f802-f117-4d20-9c57-9b2f6fc45502","resolution":{"observed_at":"2026-08-07T12:37:42.873209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:37:42.957030Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:42.957030Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:99b7d572819a739c0411c6e9fd01e449226423bfd11cbb1a99c203beb18211d1","observation_id":"bc5380aa-495b-403f-b824-c951af462fd2","resolution":{"observed_at":"2026-08-07T12:37:42.957030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08545","last_updated":"2022-11-15T22:31:38Z","snapshot_observed_at":"2026-08-16T16:15:52.382364Z","submitted_at":"2022-11-15T22:31:38Z","title":"MapQA: A Dataset for Question Answering on Choropleth Maps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.08545","snapshot_observed_at":"2026-08-07T12:37:43.047242Z","title":"Mapqa: A dataset for question answering on choropleth maps.arXiv preprint arXiv:2211.08545, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.047242Z"},"links":{"cited_paper":"/paper/2211.08545","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:fd953b847af1577e7bc8c9f1c416d084839a1e8d7a60dc4741fdc5f79bbe4570","observation_id":"a354a0fe-2f23-4469-9fb5-6d57164bfc21","resolution":{"observed_at":"2026-08-07T12:37:43.047242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-07T12:37:43.118516Z","title":"Allava: Harnessing gpt4v-synthesized data for lite vision-language models.arXiv preprint arXiv:2402.11684, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.118516Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:652a928de0f73acbc7190893e7521eeb7b2bb6d83c35bbc1359707751e45a1b5","observation_id":"0ba50aa3-3999-460d-a51b-f97816fe33cf","resolution":{"observed_at":"2026-08-07T12:37:43.118516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.02746","last_updated":"2022-12-06T04:37:51Z","snapshot_observed_at":"2026-08-16T16:10:44.189376Z","submitted_at":"2022-12-06T04:37:51Z","title":"UniGeo: Unifying Geometry Logical Reasoning via Reformulating Mathematical Expression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.02746","snapshot_observed_at":"2026-08-07T12:37:43.218009Z","title":"Unigeo: Unifying geometry logical reasoning via reformulating mathematical expression.arXiv preprint arXiv:2212.02746,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.218009Z"},"links":{"cited_paper":"/paper/2212.02746","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:1274ed6b906522c2d0d3b46b66b02a51e44c9378f8e95bddb62f8ffaac6b7ec9","observation_id":"c960d2c9-ada4-4dc6-b172-2fc19031cb0f","resolution":{"observed_at":"2026-08-07T12:37:43.218009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14517","last_updated":"2022-01-11T03:50:31Z","snapshot_observed_at":"2026-08-17T03:33:20.954386Z","submitted_at":"2021-05-30T12:34:17Z","title":"GeoQA: A Geometric Question Answering Benchmark Towards Multimodal Numerical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14517","snapshot_observed_at":"2026-08-07T12:37:43.332355Z","title":"Geoqa: A geometric question answering benchmark towards multimodal numerical reasoning.arXiv preprint arXiv:2105.14517, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.332355Z"},"links":{"cited_paper":"/paper/2105.14517","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:0d37f526153de6a4c14a9c41fa2ab4b9dbab6f49ce046cca1045f74c5f416773","observation_id":"e4615098-7cfd-4dfc-abb7-03ccc8f23df0","resolution":{"observed_at":"2026-08-07T12:37:43.332355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:56.221961Z","title":"R1-v: Reinforcing super generalization ability in vision-language models with less than $3.https://github.com/Deep-Agent/R1-V, 2025","venue":null,"work_id":"24947496-79c3-4d4b-b62b-4a443c6a7698","year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.437869Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:5a82159824d471c8a74beb31c0ec1357b399aac01971717a7e5c71f3fdac03b3","observation_id":"910e8922-4bdd-4d7c-95a5-cd450e5e09d3","resolution":{"observed_at":"2026-08-07T12:37:56.305112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T12:37:43.536170Z","title":"Are we on the right way for evaluating large vision-language models?arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.536170Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:91e75669467814054c036528adb5084c62ae73ad7f64435c912f1bb8edaca9b8","observation_id":"ad424351-a347-45cf-9118-0edb67921a5c","resolution":{"observed_at":"2026-08-07T12:37:43.536170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:37:43.644290Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.644290Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:9f697ba0d670e9c79eaa8bd63206ad760b91d7c816e4866580f12a8c1cb977f7","observation_id":"82dd815f-cc4c-4aac-a85e-a3dd84af6992","resolution":{"observed_at":"2026-08-07T12:37:43.644290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:56.042838Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"3da62171-8d35-4309-bda0-110afdf8c597","year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.735687Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:8d1996e153ae88a0c782bcf07088a3723f64573eb8ae7b2e309cb1d697e015f1","observation_id":"d1e9d65b-6059-4ad6-be0b-c45f35d4a376","resolution":{"observed_at":"2026-08-07T12:37:56.125085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:55.852845Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":"80f1ef76-91fa-40e2-bbd6-ab0a6a09a532","year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.800014Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:15b848918929499dbc25ed6f2c7ff842fad9748fcfa6f567d0059b19e19a0a7c","observation_id":"3531540a-cfb7-48ce-8f1b-fe894f167470","resolution":{"observed_at":"2026-08-07T12:37:55.949527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:55.673769Z","title":"Patch n’pack: Navit, a vision transformer for any aspect ratio and resolution","venue":null,"work_id":"20f5e115-dd2c-4f8c-bab2-fb24a2410112","year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.845422Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:bd5fac9d4f4c8ce842159c55bd6fc99682384e04268180e57bea1fe366305fe1","observation_id":"271734de-2d98-44a3-b87c-25be0653fdd4","resolution":{"observed_at":"2026-08-07T12:37:55.748517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:55.526699Z","title":"Bert: Pre-training of deep bidirec- tional transformers for language understanding","venue":null,"work_id":"1735a9ea-cd30-4aad-9a85-8091efbeaff5","year":2019},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.920685Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:6f8d199aae066518e2faf6da99f358cefcef307fb525ae1788404630fce04f13","observation_id":"d29e0a8c-db58-4aaa-aa98-07b0f9a8dac0","resolution":{"observed_at":"2026-08-07T12:37:55.599809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04620","last_updated":"2025-05-07T17:59:32Z","snapshot_observed_at":"2026-08-15T23:21:31.325849Z","submitted_at":"2025-05-07T17:59:32Z","title":"On Path to Multimodal Generalist: General-Level and General-Bench","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04620","snapshot_observed_at":"2026-08-07T12:37:43.985549Z","title":"On path to multimodal generalist: General-level and general-bench","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.985549Z"},"links":{"cited_paper":"/paper/2505.04620","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:23c083c8dbd0600782a11583c3c5904b20a960029a3beb32f0fd3337c2582c37","observation_id":"1b27fa32-f58d-4a23-b944-4dd3a2c638d1","resolution":{"observed_at":"2026-08-07T12:37:43.985549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T12:37:44.072119Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.072119Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:2f287126c2543881f19611a99c9b305c0d1175d03b1e4dc58c79a6f8d6520fae","observation_id":"fa40b409-6c78-442b-84d4-fc1701f09a5a","resolution":{"observed_at":"2026-08-07T12:37:44.072119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-15T09:15:43.841019Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-07T12:37:44.110624Z","title":"Vita-1.5: Towards gpt-4o level real-time vision and speech interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.110624Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:5b94fac58e15b74be08d710682ec920fe24d3f367be4c945c80ac2ccf75677b2","observation_id":"2d9e2b31-4beb-472a-9052-bcc9a9d5f27c","resolution":{"observed_at":"2026-08-07T12:37:44.110624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:55.383300Z","title":"Cantor: Inspiring multimodal chain-of-thought of mllm.ACM MM, 2024","venue":null,"work_id":"296a4c65-9060-40a3-8ff1-b73e32a22123","year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.208714Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:0cc7af5b935d47fc958c109da7dd74649e7f3fa4cdef3adf6735ffce68d0d5a0","observation_id":"701d8e6c-81b1-4d7a-85e4-20d51bce3fd2","resolution":{"observed_at":"2026-08-07T12:37:55.458081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:55.200207Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":"b616bc6d-2b58-4d35-9ec9-6c1e75a2d6e4","year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.295082Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:636c26e83f48c0debfdad9bc525800625c4a0229818a2052cac396f5eb39714e","observation_id":"ba33b5e7-45dd-4ffc-b33e-d25f34b1d1ed","resolution":{"observed_at":"2026-08-07T12:37:55.289867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T12:37:44.393355Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.393355Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:476b7a044ef850bac0f4fc9638523e4c75e1008137e8750772eb7919ff5dd56b","observation_id":"0812ec8e-1fea-492a-9148-2110ca2e4d0d","resolution":{"observed_at":"2026-08-07T12:37:44.393355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10441","last_updated":"2024-10-16T09:45:06Z","snapshot_observed_at":"2026-08-16T13:09:38.876999Z","submitted_at":"2024-10-14T12:35:12Z","title":"Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10441","snapshot_observed_at":"2026-08-07T12:37:44.473998Z","title":"Free video-llm: Prompt-guided visual perception for efficient training-free video llms.arXiv preprint arXiv:2410.10441, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.473998Z"},"links":{"cited_paper":"/paper/2410.10441","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:0f2031064e5ab9f2d0891736b79bec0f0563d8f2be6346a061ec97e882f528a5","observation_id":"9848067d-40d2-44bd-a3a3-aac8c40b6c7f","resolution":{"observed_at":"2026-08-07T12:37:44.473998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T12:37:44.516429Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.516429Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:cd7590c5375007ca46c9a2cbebaa3ebd4599a5a826110f4ce6a39e145102c509","observation_id":"3fa536d7-b889-42b8-afff-03f25b2f2e80","resolution":{"observed_at":"2026-08-07T12:37:44.516429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05615","last_updated":"2024-05-09T08:23:20Z","snapshot_observed_at":"2026-08-16T13:54:06.977298Z","submitted_at":"2024-05-09T08:23:20Z","title":"Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05615","snapshot_observed_at":"2026-08-07T12:37:44.565913Z","title":"Memory-space visual prompting for efficient vision-language fine-tuning.arXiv preprint arXiv:2405.05615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.565913Z"},"links":{"cited_paper":"/paper/2405.05615","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:b366fca341a7be9a4dc5deef832c1871404c9cad64296ac1ac0706f25c18e096","observation_id":"d1dc0482-7b39-4693-b682-578cc52782db","resolution":{"observed_at":"2026-08-07T12:37:44.565913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:55.021365Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":"d87f04be-e06a-4a18-ac95-57fb9db68421","year":2017},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.642885Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:0af43264989431b43b4ae1bbeaa10950d149a8acd1bc36177688be2302bf2a07","observation_id":"045da288-d805-43d5-872b-449c83ab6d74","resolution":{"observed_at":"2026-08-07T12:37:55.115246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.07300","last_updated":"2018-02-22T22:50:42Z","snapshot_observed_at":"2026-08-15T22:53:17.165603Z","submitted_at":"2017-10-19T18:01:38Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.07300","snapshot_observed_at":"2026-08-07T12:37:44.703110Z","title":"Figureqa: An annotated figure dataset for visual reasoning.arXiv preprint arXiv:1710.07300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.703110Z"},"links":{"cited_paper":"/paper/1710.07300","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:d3be94fefbf70957c9f92301b40f93289f08cc9529c3b692c8e2303dd6146bb4","observation_id":"bacc674a-5048-48a6-8529-75e556c96760","resolution":{"observed_at":"2026-08-07T12:37:44.703110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:54.865852Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"e5138560-9ca5-407b-8eb4-95b9fe62ecd9","year":2016},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.746200Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:e0ee03f2c9e0f0a35b8e1403b4628062fa253b4ace2927b1622f68e839545031","observation_id":"0140bf2a-a5ea-4d8a-a649-d9bf3e65de77","resolution":{"observed_at":"2026-08-07T12:37:54.951630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T12:37:44.784518Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.784518Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:d6c0331236e6106a837944abdced36690f2fa1ee16faaccc0591c73f3f35cc0c","observation_id":"080d880f-5ecb-4032-a0cc-3c6fb3a37e2f","resolution":{"observed_at":"2026-08-07T12:37:44.784518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T12:37:44.857093Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension.arXiv preprint arXiv:2307.16125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.857093Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:2189b128e639cfe89aefed75581d78e72d19129a741b39bb4a922930f6c3f843","observation_id":"fb4f7a2e-b358-47af-b11e-7b046b6e82c5","resolution":{"observed_at":"2026-08-07T12:37:44.857093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:54.720770Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"653a367d-1d9b-40b0-b1a9-8c2be13da8b1","year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.902929Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:40c6ce1d0e22e0835fdc920d470ffc3bf1ca16e67ea8ee478333d753a40c5058","observation_id":"2ab70df7-2694-4d02-9eac-22b516c053c1","resolution":{"observed_at":"2026-08-07T12:37:54.794908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T12:37:44.976247Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.976247Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:5188cb67e78d09baad9a72394a0a3a35a7edea609f3fa40e2719f542f9f02ea9","observation_id":"059e7857-0160-4348-a977-ab5a86d5b89e","resolution":{"observed_at":"2026-08-07T12:37:44.976247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T12:37:45.063410Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:45.063410Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:8cd98759e8f2136021c3aba0e28f0b676129e56851e88e12326ca1e065aa2800","observation_id":"311990ad-275b-4c1d-943d-b49c5c529f35","resolution":{"observed_at":"2026-08-07T12:37:45.063410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:54.522998Z","title":"Visual spatial reasoning.TACL, 2023","venue":null,"work_id":"fe1d6d1c-0836-4674-bad8-3faf26eeb4e3","year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:45.149681Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:1ada542c1b4a12b7e4d1b12da790bf8215aef63e90791058b851e5102ee1a286","observation_id":"e3d474fd-64fa-4b36-b4b2-e8e5f73f7bed","resolution":{"observed_at":"2026-08-07T12:37:54.625675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:54.348451Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"3db383db-4cc0-4e29-89c4-93a8784709c3","year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:45.152810Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:1aa89ed60b2271735e18f7211b57d9655f456009392bb9bf6bb3aa3dce4e2571","observation_id":"f8a42cc8-70a8-4716-91f5-9b8cd2cf7515","resolution":{"observed_at":"2026-08-07T12:37:54.441783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:45.234152Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:45.234152Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:91490b4ed23f70069ea9552e670a29ec24a8abb1b5de52d1ebf291bb888c10ee","observation_id":"848b80bc-c73f-4377-93be-7c36b161b31b","resolution":{"observed_at":"2026-08-07T12:37:45.234152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:54.185126Z","title":"Mmbench: Is your multi-modal model an all-around player? In ECCV, 2024","venue":null,"work_id":"d60aa43f-efa8-4c83-8dc1-9e226f1c06b0","year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:45.396245Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:233b7ed083a857ce45aab9b416232ab5f18848f2782b05dd29a4e5914f4ba675","observation_id":"f937c7b9-8cfc-4f61-9ad7-50ae0c9f615b","resolution":{"observed_at":"2026-08-07T12:37:54.262844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:54.064575Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models","venue":null,"work_id":"0a9b3a7a-e0ca-4794-9400-31ceb2f59fc5","year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:45.618007Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:0fdc8660ddf0448980f8aa4b67cea91dfe4b154d2115d8d8a4c225bfd24af43c","observation_id":"aec24713-eebd-41a3-a6c3-f838f33c3b54","resolution":{"observed_at":"2026-08-07T12:37:54.130873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-07T12:37:45.787946Z","title":"Deepseek-vl: towards real-world vision-language understanding.arXiv preprint arXiv:2403.05525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:45.787946Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:b711abc75faaf86bb62ac014cc42a3ace4713ad7d77b10d9859bb9d7ab6e4f09","observation_id":"49741e44-f24e-421a-9897-31100a89f9e4","resolution":{"observed_at":"2026-08-07T12:37:45.787946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:53.898719Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":"53053182-bfb2-4b17-97df-506c62cde606","year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:45.960301Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:eae10a8ac4c17a55cbd5fe58950ba8d9bd5254613a986195db76e58741883500","observation_id":"14856869-d85c-4176-9161-29c064ad3d38","resolution":{"observed_at":"2026-08-07T12:37:53.983355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:53.733995Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"0d565392-29b6-4bcd-a8a4-484f4ffda67a","year":2022},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:46.128342Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:45ffb22d821ed789ebd8beca30a8607dbbd985811ec561d5c7a5a56a5dcc7f4c","observation_id":"6a495537-6ea1-4de9-9765-6701e7bbcf4e","resolution":{"observed_at":"2026-08-07T12:37:53.808532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:53.559028Z","title":"Cheap and quick: Efficient vision-language instruction tuning for large language models.NeurIPS, 2023","venue":null,"work_id":"065e1327-aa21-45dd-975e-e07652af2546","year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:46.363496Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:ed240ba96b00bf854ec12350037e93b38ce90332260941e2dbbba8fda7e182dd","observation_id":"4a02b294-cac4-4826-b864-84262d5b913c","resolution":{"observed_at":"2026-08-07T12:37:53.634049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-16T14:12:38.033838Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-07T12:37:46.509499Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models.arXiv preprint arXiv:2403.03003,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:46.509499Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:cdefdcc98f9b7ad9f33feeefc9d2bba057d8a15e7a3dac082fe402bfdc6a52a6","observation_id":"7d0232be-36ae-4f25-a436-a166fe6a183e","resolution":{"observed_at":"2026-08-07T12:37:46.509499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:46.617047Z","title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension.arXiv preprint arXiv:2411.13093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:46.617047Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:ea43fccabb1aed6af07f9a11f6a3df7d9175abdbc022c2a0eea0c6c15c914b42","observation_id":"90b0c37c-04c1-4dc9-93d3-0e3233b263b0","resolution":{"observed_at":"2026-08-07T12:37:46.617047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20502","last_updated":"2025-03-30T03:54:36Z","snapshot_observed_at":"2026-08-16T12:46:39.487840Z","submitted_at":"2025-03-26T12:42:37Z","title":"MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20502","snapshot_observed_at":"2026-08-07T12:37:46.790491Z","title":"Mllm-selector: Necessity and diversity-driven high-value data selection for enhanced visual instruction tuning.arXiv preprint arXiv:2503.20502, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:46.790491Z"},"links":{"cited_paper":"/paper/2503.20502","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:998f044e71086f0f7e265faa8821ed5ec401ecdbd0033ac6f937b89a684c0f15","observation_id":"a972f16f-ab27-413d-8770-72947fbea608","resolution":{"observed_at":"2026-08-07T12:37:46.790491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:53.401849Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"58973b82-993b-48ce-af74-89885494b838","year":2016},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:46.908031Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:74d6e9d9d3f82d2e2eb09cd121fbce87a43a42facab3d0f9ea347eb56f4f2e98","observation_id":"db05e5a2-683a-422b-9098-eb214b87e391","resolution":{"observed_at":"2026-08-07T12:37:53.474140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T12:37:47.054610Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning.arXiv preprint arXiv:2203.10244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:47.054610Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:51106d9d1b5a4040de25496d7b395d19228ba6296414c06d3a43a64e8ad330ba","observation_id":"6aa570e5-7757-4a4d-9507-a2c62a29d32a","resolution":{"observed_at":"2026-08-07T12:37:47.054610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:53.255411Z","title":"Infographicvqa","venue":null,"work_id":"54bd602c-cef2-4577-8120-4ba3629ae91e","year":2022},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:47.219388Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:0a3e30477b453a2308acdabd9943e61dbe4e67c4f18d62008e7ef916a60468c2","observation_id":"feb65134-920d-4bf9-8fbb-cd50e46492e0","resolution":{"observed_at":"2026-08-07T12:37:53.318799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:53.055959Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"09634144-119f-436b-9846-5e4758430181","year":2021},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:47.344366Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:960765ad18f8e31690bc2fe09a2a79b8e9ae53d1c0db82b1645a34c0985fe439","observation_id":"eb606e72-c086-4dac-bfbc-73847b3c9101","resolution":{"observed_at":"2026-08-07T12:37:53.165749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-13T20:16:31.803514Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T12:37:47.537408Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning.arXiv preprint arXiv:2503.07365, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:47.537408Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:7df44978afbbce59f0428c83d1a019f122be0e51085fa39e3ed6d70e02aa4165","observation_id":"a7e68bb9-1055-4b61-88d0-f5951e67213b","resolution":{"observed_at":"2026-08-07T12:37:47.537408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:52.785943Z","title":"Training language models to follow instructions with human feedback.NeurIPS, 2022","venue":null,"work_id":"874ab487-ba34-4d61-a6f1-4ba90191b76f","year":2022},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:47.706893Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:33ea66127a33c598e8340fbdf5cd18c29a8f95f07935bb6721bf419d70eb4844","observation_id":"9d097eab-a669-4ed7-9c41-8431050b7f92","resolution":{"observed_at":"2026-08-07T12:37:52.920910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:47.865340Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:47.865340Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:33089ba26de8b321e7627336154816ca67b4aedda52e0d54044a3bfd99212f1b","observation_id":"e11f3118-abc1-47d5-8ca4-0dd272df0855","resolution":{"observed_at":"2026-08-07T12:37:47.865340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:52.583798Z","title":"Direct preference optimization: Your language model is secretly a reward model.NeurIPS, 2023","venue":null,"work_id":"8c728ead-ddd9-4054-a8c2-c13e9a9fe173","year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.030928Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:0e6cf2f48cfe9e8ef8ab815ad983dc6d0844d5ffdf3c3c65d8bc8b67bf901ef3","observation_id":"c0ff8c5d-9f1b-41e6-911a-855075ae6886","resolution":{"observed_at":"2026-08-07T12:37:52.695218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-17T18:00:27.329541Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-08-07T12:37:48.199482Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts.arXiv preprint arXiv:2501.04322, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.199482Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:e7a301a2c9854b562d2cd08b9668574048db7ff3d729e156fce7329edf0c793e","observation_id":"879f13ae-d0b9-4b5c-a844-38f843aaf72a","resolution":{"observed_at":"2026-08-07T12:37:48.199482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-07T12:37:48.318387Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.318387Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:3255c5fbce433c554e020359aced2f4485ac0422b3c2824962ff4c8ffd641d08","observation_id":"791d5a95-3c79-490a-b88c-e20176d1b599","resolution":{"observed_at":"2026-08-07T12:37:48.318387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T12:37:48.437328Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.437328Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:639f336fcfd6b2decc913a6e5735d970cb8b0bfd5e01f5bc5834210add25c923","observation_id":"a8abd1ea-e136-48d5-a244-bb3c22e22062","resolution":{"observed_at":"2026-08-07T12:37:48.437328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:37:48.531778Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.531778Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:21eae3d56c4f314485a0c2c6d687f0b20c05d2c81b3f13c58c5d8fd680e77cdf","observation_id":"d0afd5ec-f21b-4d35-8aca-16b8b8b998d0","resolution":{"observed_at":"2026-08-07T12:37:48.531778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-14T23:38:19.973422Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T12:37:48.622594Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.622594Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:216cb830945418bf7eb0cb5fc5cd3845d5adb0d7b7648520e89846f34c9480ef","observation_id":"75ff2723-9024-4e4a-883d-f23746d7593b","resolution":{"observed_at":"2026-08-07T12:37:48.622594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:48.691734Z","title":"Long-vita: Scaling large multi-modal models to 1 million tokens with leading short-context accuray.arXiv preprint arXiv:2502.05177, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.691734Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:4a733fa7406ff8517def5b82aeec8a01b8a72066d6c5d28448da2df011f66be8","observation_id":"2323e1fd-fc9b-4b47-9264-b649af1f9014","resolution":{"observed_at":"2026-08-07T12:37:48.691734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T12:37:48.782938Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.782938Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:26809d5c4f8c8b136ee9425536768e2415e5f50407cf9d677ea93a5fcffd85e0","observation_id":"020874f4-2c31-4234-a8ee-10e3083fa6cc","resolution":{"observed_at":"2026-08-07T12:37:48.782938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:37:48.877517Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.877517Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:b4a993d28319f6c90c0176a6e6e56da4f457ac025655f4109c6922a7bcfb2543","observation_id":"13ea1e57-dedf-46a7-90b6-3388db6d6b98","resolution":{"observed_at":"2026-08-07T12:37:48.877517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-08-13T01:56:18.092262Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-08-07T12:37:48.974699Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset.arXiv preprint arXiv:2402.14804, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.974699Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:fbe6270a34b8d1457ec38edc452e1302d304a2952dee7058baae0930827eb6cd","observation_id":"61cfd93d-8772-489c-9a56-e7c2efee99cf","resolution":{"observed_at":"2026-08-07T12:37:48.974699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T12:37:49.073537Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:49.073537Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:d21a382c9cb361ff57f94333158e3eb4b06458820b739165ab03c17d5c51a6a8","observation_id":"e22b9b99-6fa5-4feb-9213-419fb69ecb85","resolution":{"observed_at":"2026-08-07T12:37:49.073537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13663","last_updated":"2024-12-19T06:32:26Z","snapshot_observed_at":"2026-08-16T17:36:35.256420Z","submitted_at":"2024-12-18T09:39:44Z","title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13663","snapshot_observed_at":"2026-08-07T12:37:49.199326Z","title":"Smarter, better, faster, longer: A modern bidirectional encoder for fast, memory efficient, and long context finetuning and inference.arXiv preprint arXiv:2412.13663, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:49.199326Z"},"links":{"cited_paper":"/paper/2412.13663","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:769976e793b1ac9b8079ac230075990cb011bd4cf46976739c2921724facad82","observation_id":"bc7baed4-4b75-4a71-ad43-1f2c7c87d3b2","resolution":{"observed_at":"2026-08-07T12:37:49.199326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-08-17T05:35:17.658314Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-07T12:37:49.263799Z","title":"Qwen2.5-1m technical report.arXiv preprint arXiv:2501.15383,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:49.263799Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:d88130f530e391f73b48991d48eda51c32ff779ae9e222abe4679f30b7e38154","observation_id":"9b330a79-d238-4eb8-889c-aa84aefb3fce","resolution":{"observed_at":"2026-08-07T12:37:49.263799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-15T09:44:57.157415Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-07T12:37:49.357574Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization.arXiv preprint arXiv:2503.10615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:49.357574Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:9d96d8690000a4ecb6cfe28e15045aac857a2a31977680869d7cb89aa5aa8ce8","observation_id":"9297dae2-6215-44be-8af7-ec6c6cb9706f","resolution":{"observed_at":"2026-08-07T12:37:49.357574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T12:37:49.453135Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:49.453135Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:e699579a48aaf2f6cda4155bfdca3c8aceb936a0be5ccb51f032ded60f0cd944","observation_id":"575783b0-dd21-4941-b5eb-464ca8c32aea","resolution":{"observed_at":"2026-08-07T12:37:49.453135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-18T03:16:44.825874Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T12:37:49.581401Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities.arXiv preprint arXiv:2308.02490, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:49.581401Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:f6afee5499ac2c6e543087ec3f08d218bcb3599db16d6cd65a0a669e7ec1f5c9","observation_id":"6ee38d23-7e1c-47d9-9d2f-37e72a156375","resolution":{"observed_at":"2026-08-07T12:37:49.581401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-16T10:23:40.545862Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-08-07T12:37:49.696896Z","title":"Sa2va: Marrying sam2 with llava for dense grounded understanding of images and videos.arXiv preprint arXiv:2501.04001, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:49.696896Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:fcc798626e378a83cf116f7745be2690dd818253c457ed16e25ac5f21a3089ac","observation_id":"20fefdf2-e833-4a4e-aee3-f6208b8e0f46","resolution":{"observed_at":"2026-08-07T12:37:49.696896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:52.389357Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"c66ad354-05f7-434e-9cff-3e197a7ba207","year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:49.827448Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:2b727d08e751f46d35c5fa415b8a958db82ed177857f1d42ac68030a6ff58ba8","observation_id":"7099775a-08ff-495f-82ff-6a60aa94f3bf","resolution":{"observed_at":"2026-08-07T12:37:52.485583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:52.225933Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"78b7af76-df01-46cd-ba01-3b0c62bec1fc","year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:49.936532Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:301290a23fccea99a56574335167d8537989e6840be5a095d3b08107b1a29a12","observation_id":"7976af05-89f0-42e2-a8c6-20aa80e3b659","resolution":{"observed_at":"2026-08-07T12:37:52.301424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-16T23:37:49.144529Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-07T12:37:50.037158Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision-guided reinforcement learning.arXiv preprint arXiv:2503.18013, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.037158Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:dad338695348f039cef38f2631d6f6d72b64d619458482cdf056bcdc71597d87","observation_id":"9b77ae93-91de-49b5-8e52-1196ea0c1596","resolution":{"observed_at":"2026-08-07T12:37:50.037158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-08-14T07:51:18.307451Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T12:37:50.123928Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models.arXiv preprint arXiv:2407.12772, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.123928Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:562eb04db86a30ff3c9006772a6a64cfcf29ee3e5f7dfc97c2ade3812a7a15e2","observation_id":"cb348a27-c885-4a0a-9667-9fb0ed96adda","resolution":{"observed_at":"2026-08-07T12:37:50.123928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:52.054130Z","title":"Omg-llava: Bridging image-level, object-level, pixel-level reasoning and understanding","venue":null,"work_id":"217dfb22-ec5c-4f97-aa0a-eae9642997b6","year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.210810Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:4990aa8834d191435813bd2e7b2854178f2c2729c64a6f5ed547238cf296191c","observation_id":"71428098-f6cc-4eec-83ea-f68eedcd226a","resolution":{"observed_at":"2026-08-07T12:37:52.132720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10465","last_updated":"2025-04-14T17:52:22Z","snapshot_observed_at":"2026-08-16T12:41:13.823758Z","submitted_at":"2025-04-14T17:52:22Z","title":"Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10465","snapshot_observed_at":"2026-08-07T12:37:50.273762Z","title":"Pixel-sail: Single transformer for pixel-grounded understanding.arXiv preprint arXiv:2504.10465, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.273762Z"},"links":{"cited_paper":"/paper/2504.10465","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:c862a8ca721398c3ad6ee5237f2f4783234846e7e6c650cb89ef71904710d6cc","observation_id":"5984fb9c-150c-4bbd-9f4c-cb0289374dcf","resolution":{"observed_at":"2026-08-07T12:37:50.273762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:51.857945Z","title":"Enhancing multimodal large language models complex reason via similarity computation.AAAI, 2024","venue":null,"work_id":"19e5391e-8239-4e8f-9429-c217223d6b19","year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.386378Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:c07285d4a11623ec7d8864d786b0ffe0846ad58272e175dad816a243407d726b","observation_id":"5be7b6d3-807f-4516-908c-2ae4f0eb2d20","resolution":{"observed_at":"2026-08-07T12:37:51.942715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:51.642688Z","title":"MultiHiertt: Numerical reasoning over multi hierarchical tabular and textual data","venue":null,"work_id":"64bb9197-fec4-44e1-bd28-2c18904441bb","year":2022},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.496263Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:0b906b757e0f0730bc50f2e31f495977ec45ea49f9b8f190f62cc421f5e1ff81","observation_id":"3b8c0bd6-739c-4e66-bd74-6d7741264b85","resolution":{"observed_at":"2026-08-07T12:37:51.749703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T12:37:50.564213Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding.arXiv preprint arXiv:2406.04264, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.564213Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:c3ecc24e3d20a593565e408445770690b92b8878ca159da3a92943b5a826283e","observation_id":"627beefb-2d62-4fc4-9721-e296d26b16a3","resolution":{"observed_at":"2026-08-07T12:37:50.564213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04670","last_updated":"2025-07-09T08:04:21Z","snapshot_observed_at":"2026-08-14T03:18:34.834807Z","submitted_at":"2025-01-08T18:30:53Z","title":"Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04670","snapshot_observed_at":"2026-08-07T12:37:50.658662Z","title":"Are they the same? exploring visual correspondence shortcomings of multimodal llms.arXiv preprint arXiv:2501.04670, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.658662Z"},"links":{"cited_paper":"/paper/2501.04670","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:dd5ddeda92cfbb6e21ec6928a97c2b876cd685eb65afbc19f217805e8f839e0a","observation_id":"b1c18b3a-35d8-48a1-9128-c02701f41d19","resolution":{"observed_at":"2026-08-07T12:37:50.658662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T12:37:50.749824Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.749824Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:2be20783d7cdf99903c04728ba3db05d23744f4d81effcdfe2ac339be55a5253","observation_id":"ea093f35-2b5b-40ce-9134-c4dd340489b8","resolution":{"observed_at":"2026-08-07T12:37:50.749824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:51.473608Z","title":"Genimage: A million-scale benchmark for detecting ai-generated image.NeurIPS,","venue":null,"work_id":"e6e13f78-0d8b-4a76-8b09-0516df140dae","year":null},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.854503Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:b74285b49c83e922f565053729b5929a7dfccef801b863df29d23fa9704f6666","observation_id":"9105b61a-f351-4ab7-be17-3628b1c0f762","resolution":{"observed_at":"2026-08-07T12:37:51.554229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 3 inbound Pith citation observations for arXiv:2505.24164."}