{"as_of":"2026-08-09T17:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ccade3ede6b0a2293cb89c03647c804cc5a3b55a1ca07e51f27c42a7ab1b3b5c","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:19:33.840820Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:15:52.772665Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T22:24:00.434533Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.24871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24871","snapshot_observed_at":"2026-06-29T22:24:00.434533Z","title":"Modomodo: Multi-domain data mixtures for multimodal LLM reinforcement learning.CoRR, abs/2505.24871, 2025","venue":null,"work_id":"02c93aaf-d5d6-4535-b924-aee394832f18","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2505.24871","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:904d2dff3dcb217ee96f1e139f01dd9c50ec04bbe9f86d9b1521f7da60ede878","observation_id":"bb4826de-a215-4f05-b0f8-2f7d09409a9e","resolution":{"observed_at":"2026-05-19T05:12:04.799535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24871","snapshot_observed_at":"2026-08-04T08:15:52.772665Z","title":"Modomodo: Multi-domain data mixtures for multimodal llm reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.21978","last_updated":"2026-06-18T16:29:38Z","snapshot_observed_at":"2026-08-09T00:06:37.608642Z","submitted_at":"2025-10-24T19:08:48Z","title":"Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T08:15:52.772665Z"},"links":{"cited_paper":"/paper/2505.24871","citing_paper":"/paper/2510.21978"},"observation_digest":"sha256:b181f118f4f5b82ef0e643b4a7943a960d529cc6a86c8e08c4a48d9365164c9d","observation_id":"2917cdcd-d538-4c7a-851d-80e5c0bc0eed","resolution":{"observed_at":"2026-08-04T08:15:52.772665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24871","snapshot_observed_at":"2026-08-03T04:17:27.630062Z","title":"Modomodo: Multi-domain data mixtures for multimodal llm reinforcement learning.arXiv preprint arXiv:2505.24871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05547","last_updated":"2026-08-05T16:57:37Z","snapshot_observed_at":"2026-08-08T23:12:50.234380Z","submitted_at":"2026-02-05T11:06:37Z","title":"Multi-Task GRPO: Reliable LLM Reasoning Across Tasks","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T04:17:27.630062Z"},"links":{"cited_paper":"/paper/2505.24871","citing_paper":"/paper/2602.05547"},"observation_digest":"sha256:0a648535eba144c600a063740c31b2364993fcf8ed1a337336864b00e71d10e7","observation_id":"ed54ce13-893a-4ea7-b882-229b449251d0","resolution":{"observed_at":"2026-08-03T04:17:27.630062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.24871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24871","snapshot_observed_at":"2026-06-29T22:24:00.434533Z","title":"Modomodo: Multi-domain data mixtures for multimodal LLM reinforcement learning.CoRR, abs/2505.24871, 2025","venue":null,"work_id":"02c93aaf-d5d6-4535-b924-aee394832f18","year":2025},"citing_paper":{"arxiv_id":"2605.25443","last_updated":"2026-05-25T05:42:57Z","snapshot_observed_at":"2026-07-06T23:35:26.687529Z","submitted_at":"2026-05-25T05:42:57Z","title":"Harmony in Diversity: Multi-domain Contrastive Policy Optimization for Large Reasoning Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T22:18:10.508034Z"},"links":{"cited_paper":"/paper/2505.24871","citing_paper":"/paper/2605.25443"},"observation_digest":"sha256:38d572bb222e7cc8215191aa553700d797e368f89595cce14d8f656e23ecaa7b","observation_id":"2305ebed-33fd-4d4f-bbe1-e088f0d8af4c","resolution":{"observed_at":"2026-06-29T22:24:00.436153Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24871","snapshot_observed_at":"2026-08-01T11:47:24.668308Z","title":"MoDoMoDo: Multi-domain data mixtures for multimodal LLM reinforcement learning.arXiv preprint arXiv:2505.24871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-06T04:55:07.559078Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:24.668308Z"},"links":{"cited_paper":"/paper/2505.24871","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:1720d10f137c4f2d6d054f562847a31edef94fa2caa38809545c3c43df1664af","observation_id":"5caa1d1d-90d8-4143-9426-0394621fd17e","resolution":{"observed_at":"2026-08-01T11:47:24.668308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24871/citation-record","integrity":"/paper/2505.24871/integrity","json":"/paper/2505.24871/citation-record.json","paper":"/paper/2505.24871"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:26.779861Z","title":"Alayrac, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:26.779861Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:65ee7332068487ea9d94726785689e8ef6b7a2b30451c7d25f111f91544e95c4","observation_id":"2dc90553-8ba9-43d5-a898-a69e774daed7","resolution":{"observed_at":"2026-08-07T12:19:26.779861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-09T06:28:25.884378Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-07T12:19:26.845188Z","title":"Albalak, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:26.845188Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:41b2fb71e64d7eef38eb34f7141cc7903d54fd3a8db18d938935e0fadb8ce4d4","observation_id":"f3e214dd-d14f-4ad1-af5b-4b898e03b140","resolution":{"observed_at":"2026-08-07T12:19:26.845188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-07T12:19:26.919852Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:26.919852Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:4b11894148e43775c39bc22872ed8668c83a1e523751c669e159a1cb99b6adf5","observation_id":"00e694f5-71e2-49b2-aafa-6c45738c459f","resolution":{"observed_at":"2026-08-07T12:19:26.919852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:40.263043Z","title":null,"venue":null,"work_id":"6bd382a5-fb48-4976-b77e-14ca109396b5","year":2024},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:27.126736Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:9fd21cb15b1f9f92d2f4102674eceb8c90d48c609af38c787e1ae2abafd82755","observation_id":"1b1e10be-3f0d-4fff-bd10-b63f1a4eb349","resolution":{"observed_at":"2026-08-07T12:19:40.339394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:40.142924Z","title":null,"venue":null,"work_id":"c04f0d56-a580-41db-980c-13d226632f29","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:27.222872Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:7b8016444b4c54d9b18296ac7e801781b162adc1b3263fcccd1b13d8a7145ca0","observation_id":"0693db7d-7433-4d89-9fec-4b76efbc542e","resolution":{"observed_at":"2026-08-07T12:19:40.188757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:40.009509Z","title":null,"venue":null,"work_id":"005bab9a-fa46-4335-a05b-793b0e278543","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:27.317891Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:e9ba855f0d51b9e13926c35c5d4b7db921c8cbd1dfa66535c087488a93498ea8","observation_id":"9fab8f8f-2d3a-4d91-b582-ce7504e130dc","resolution":{"observed_at":"2026-08-07T12:19:40.080528Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:39.857469Z","title":null,"venue":null,"work_id":"3b59e43a-af33-4476-b821-e6864d001006","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:27.412658Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:dafbd68cd563ea3dae88e521ca276a4d283d053663964c539b80da78273a74a9","observation_id":"09960a24-cca9-4205-b572-34c56db39c0a","resolution":{"observed_at":"2026-08-07T12:19:39.936695Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:39.719722Z","title":null,"venue":null,"work_id":"c42214b1-404a-42ec-918a-de911d8ff96b","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:27.484727Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:5ffe595a0e01903a09eee22a5faa6cbb4adcec7aa82ef8f6597c8ade5c65238e","observation_id":"4f4c7406-6758-4888-825c-15e77db8b3cf","resolution":{"observed_at":"2026-08-07T12:19:39.796438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09151","last_updated":"2023-04-18T17:45:50Z","snapshot_observed_at":"2026-08-04T20:02:02.999092Z","submitted_at":"2023-04-18T17:45:50Z","title":"UniMax: Fairer and more Effective Language Sampling for Large-Scale Multilingual Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09151","snapshot_observed_at":"2026-08-07T12:19:27.565628Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:27.565628Z"},"links":{"cited_paper":"/paper/2304.09151","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:c4aba75e6c15a62dcba51b6abe2f357ef158f78e5696d0d0a647f23e6ab1c646","observation_id":"2344a5a9-f500-4012-b701-1bcb8274e308","resolution":{"observed_at":"2026-08-07T12:19:27.565628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:39.574177Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.ArXiv Preprint, 2025","venue":null,"work_id":"ab617c23-e0f4-4c5b-9948-cf0018639a5d","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:27.638764Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:f33de1add6353f0732cd89ddec76b4fef5995e613abbe5fad4ac9359482d893e","observation_id":"2b9990b6-8dc9-4bee-a015-bc7eb4ced88f","resolution":{"observed_at":"2026-08-07T12:19:39.655261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:39.427268Z","title":null,"venue":null,"work_id":"3842409b-b87a-4e4d-afd1-f1fa0feb3aac","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:27.721544Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:07ea7f33e9cfe3a5ff5ab99aea65bcc44b88e09509f13f599932494eaad0b444","observation_id":"79346d66-c34d-4823-8d39-2c09636ce64d","resolution":{"observed_at":"2026-08-07T12:19:39.507566Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:27.793435Z","title":"Devlin, M.-W","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:27.793435Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:ab2acf7a2d8fbd307a6ef95c120bfe8e2c9af826f52e07d71c5b44a677e547d3","observation_id":"6ea1a21b-84b2-436f-ba79-57296eaa9c93","resolution":{"observed_at":"2026-08-07T12:19:27.793435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:39.325558Z","title":null,"venue":null,"work_id":"0c73d76c-a457-41fa-a5f7-7cea65d38cbc","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:27.940368Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:29d7ec05ec780d5c24a59313344790e886e235b083c9c39279319a6c142bde46","observation_id":"0789acc3-b5e4-4148-acb8-715928a1d3fb","resolution":{"observed_at":"2026-08-07T12:19:39.359011Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T12:19:28.455709Z","title":"Havrilla, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:28.455709Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:a6e73e70e9360149cf4c216d20457ebdb908ae139109d38407df05ce9b64bc95","observation_id":"e135594d-1c46-4d77-8a61-9b2fe77ab4d0","resolution":{"observed_at":"2026-08-07T12:19:28.455709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11747","last_updated":"2025-01-23T20:45:47Z","snapshot_observed_at":"2026-07-06T20:23:36.052687Z","submitted_at":"2025-01-20T21:10:22Z","title":"Optimizing Pretraining Data Mixtures with LLM-Estimated Utility","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11747","snapshot_observed_at":"2026-08-07T12:19:28.566337Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:28.566337Z"},"links":{"cited_paper":"/paper/2501.11747","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:de57853d5229d7ded13def983cd03ba860866efb547ee74a578d01f6a9e76b16","observation_id":"37c2ea2a-7d24-4ba1-9296-5a561771ff43","resolution":{"observed_at":"2026-08-07T12:19:28.566337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T12:19:28.647433Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:28.647433Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:d8cb42538a14445eeb4c42c2ded458356957532edff6cc43776e0d932a89630a","observation_id":"ca94893b-7245-4457-820f-027ef55c824e","resolution":{"observed_at":"2026-08-07T12:19:28.647433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00622","last_updated":"2022-02-01T18:15:24Z","snapshot_observed_at":"2026-08-09T04:57:14.602603Z","submitted_at":"2022-02-01T18:15:24Z","title":"Datamodels: Predicting Predictions from Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00622","snapshot_observed_at":"2026-08-07T12:19:28.727706Z","title":"Ilyas, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:28.727706Z"},"links":{"cited_paper":"/paper/2202.00622","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:e2010781a426909840922871b60db063f48bc8864cf37f1869b77e365d98642c","observation_id":"e4778dbe-e24c-4b26-8d07-f77022815ca7","resolution":{"observed_at":"2026-08-07T12:19:28.727706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:39.201860Z","title":"Kazemnejad, M","venue":null,"work_id":"3808af5e-1a58-4d22-84c8-d1b79425c1cd","year":2024},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:28.796216Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:b8d35cf929bb568e1ec65c63d3f2daedb44fcb9d696f277bfd289411fafbdbf1","observation_id":"7fec577c-30d3-4dca-bc9d-0105e7d12de0","resolution":{"observed_at":"2026-08-07T12:19:39.270411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:28.867759Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:28.867759Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:cc5a0ba037d118a6edaeccb4d69597c244c4d20b3556834835946f68b8c64ff2","observation_id":"cc549ef2-8849-4736-990d-a8cc6a122214","resolution":{"observed_at":"2026-08-07T12:19:28.867759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:39.083246Z","title":null,"venue":null,"work_id":"a906a58a-faf7-4cb5-a80e-6ca83b06af75","year":2023},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:28.981683Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:a076b718d409935456abdaed991e1512a073db96de1c68cf549bd9c98f4e7af4","observation_id":"454816c9-254c-4c12-9dff-b963bfc79b26","resolution":{"observed_at":"2026-08-07T12:19:39.139184Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-07-06T16:13:07.384791Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-07T12:19:29.080379Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:29.080379Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:cde05d202a5e7f8b536bfd634e040f8b95564de5de14081f6dc0e0adcc7fb914","observation_id":"1cccf3fd-6ce4-423e-8ea0-56de82d54d1e","resolution":{"observed_at":"2026-08-07T12:19:29.080379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:38.953934Z","title":null,"venue":null,"work_id":"15137ed1-8db6-4485-b674-1e19d75ccd52","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:29.172653Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:1187cde893e456a6e79c2b93733ddea2c5646fd9e53b4ed8dcc8b88f0732c9e7","observation_id":"4c5086ab-e6f3-4a30-be7a-b50e5ced75d9","resolution":{"observed_at":"2026-08-07T12:19:39.023631Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:38.843032Z","title":null,"venue":null,"work_id":"62f7b87a-2603-479b-acde-bc680a6cfebe","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:29.305826Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:1848e0c3575dbce15df56640a330356337577de65f12f926b665488e776b950a","observation_id":"0509d813-4b14-4f76-9936-5fb14ced841a","resolution":{"observed_at":"2026-08-07T12:19:38.908662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:38.721631Z","title":null,"venue":null,"work_id":"eab9b022-b477-41f2-b132-d1bc3e6c17a8","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:29.375324Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:5412832a8143ceed7ece693f068d4ec4cb1af5f875abaab6a8cb94638e3126a1","observation_id":"c6b2d7ee-8903-4e5f-800a-4a7f606b1c26","resolution":{"observed_at":"2026-08-07T12:19:38.768227Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T12:19:29.463877Z","title":"Liang, W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:29.463877Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:4e172ba6639079713d1b021c3ffacc6d912195b2222d7289c57ace069f661ed9","observation_id":"3306c2d2-a036-43da-9e03-02a335611353","resolution":{"observed_at":"2026-08-07T12:19:29.463877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:38.571656Z","title":null,"venue":null,"work_id":"4f46fe0c-3013-4cde-b887-ff916fca4dd4","year":2014},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:29.585191Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:43fba1a1e9bf807e01bcd752406a3e3e5a6d1741d87e59ab06a24c8ccda47eb2","observation_id":"63641a10-1a9d-4b77-b9a8-2555350f9de6","resolution":{"observed_at":"2026-08-07T12:19:38.662831Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:38.372959Z","title":null,"venue":null,"work_id":"592beb3e-2d0c-4b5a-aef4-1849cbcd969b","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:29.678228Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:9e4b07d8ec019f8ee0d223ca7f3beeeca1870a9824f15f236145a3cf457af11e","observation_id":"ebbcf531-7dbb-4c0c-ac47-90e97aff91e5","resolution":{"observed_at":"2026-08-07T12:19:38.470944Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:29.779738Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:29.779738Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:2029222c563b9f7011ef55e0a593851838c782f62c8d5efb566401f31dd83436","observation_id":"1d85ef55-57af-4a92-a40e-93f2e3046e45","resolution":{"observed_at":"2026-08-07T12:19:29.779738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T12:19:29.907802Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:29.907802Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:779e8b80aa345683ef05433aca1c0e44a930dc8c70d7f00c9dd8a072d825f77b","observation_id":"7fb0ce7a-3ae3-4735-a501-a108e128d0cb","resolution":{"observed_at":"2026-08-07T12:19:29.907802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01492","last_updated":"2025-01-23T17:35:43Z","snapshot_observed_at":"2026-08-09T06:27:14.768185Z","submitted_at":"2024-07-01T17:31:03Z","title":"RegMix: Data Mixture as Regression for Language Model Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01492","snapshot_observed_at":"2026-08-07T12:19:30.003107Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:30.003107Z"},"links":{"cited_paper":"/paper/2407.01492","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:343ad9852ae7fffc9a96020258e54efb8e5751b41183994c970d1e916c3cac42","observation_id":"102a6ad2-1187-4852-a81b-9834676a21ac","resolution":{"observed_at":"2026-08-07T12:19:30.003107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:38.160954Z","title":null,"venue":null,"work_id":"89949dce-9061-4074-a7ab-bc1610cba107","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:30.076011Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:6c6d3818adb9b325f6d75263f3b20b36c712be9f94a0eebf7b14baf52002eccf","observation_id":"dd864dc0-3ecf-4ea1-9b0e-2e11bbfa8ceb","resolution":{"observed_at":"2026-08-07T12:19:38.256009Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:37.989722Z","title":null,"venue":null,"work_id":"a558a614-b9e7-4550-ba20-f6c8fe177356","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:30.201326Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:127db2be9b2ebecc8ee0d6c51837ab2d3a19b045c8e2dfb30fd0a7b02a7bfda1","observation_id":"0c60ca46-2971-49c5-948b-02858424b992","resolution":{"observed_at":"2026-08-07T12:19:38.060622Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:37.805559Z","title":null,"venue":null,"work_id":"fbf29ae4-5951-483a-8458-8a857163820e","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:30.290991Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:bcdcb225d52b613ef7fa0a17d47bd0a9f2ae8fb9c896a81882ea5c4bbdcdaccd","observation_id":"b2c552c9-0fc2-461c-b13e-6cafda9e26f9","resolution":{"observed_at":"2026-08-07T12:19:37.885730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:37.635831Z","title":null,"venue":null,"work_id":"b9eeaabd-08d3-4a30-a55a-6a281b34c12e","year":2022},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:30.379806Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:46d1790222f06fb7c6ca55ef568e21762cc6ac4a76ff3958adf3841f3ee67724","observation_id":"63d2c6ca-82ff-491b-9fac-58dc5be8544b","resolution":{"observed_at":"2026-08-07T12:19:37.732944Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:37.451964Z","title":null,"venue":null,"work_id":"e3f01871-47f9-451c-b02e-4ee0f17b4db5","year":2024},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:30.468138Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:2d8dc099565e32b9c16b9cc4257c3c4291264a87170a029a592546ec920e5e22","observation_id":"98ec5f18-7a3f-447c-8cad-a5c5a083d1b3","resolution":{"observed_at":"2026-08-07T12:19:37.556322Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:37.229808Z","title":null,"venue":null,"work_id":"9fedf8c9-e71a-4039-b9da-ac59b2dd1fcf","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:30.566713Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:926b99f508779732815f09b9c01fc211fabd831f56e25ea6e43807687964394b","observation_id":"69ff9057-a129-4833-a766-311e787d8227","resolution":{"observed_at":"2026-08-07T12:19:37.336711Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T12:19:30.662556Z","title":"Masry, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:30.662556Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:d5a50dfe1d1451e991fc6105e932aa8eacf4c1a1424ce093add9bc1a5206d855","observation_id":"4db49e7b-67f9-4fcc-924e-d1eeb347f82e","resolution":{"observed_at":"2026-08-07T12:19:30.662556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:37.012637Z","title":"Mathew, V","venue":null,"work_id":"9961774b-57f4-415b-adbc-2f1aa6017d19","year":2022},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:30.770327Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:94b31fc3fb51a5c3b4438760c9396b23659bccf93466147de2a9d7cd6f33778b","observation_id":"0d2b4e5c-f726-46dd-9e54-1c92dd1fc29a","resolution":{"observed_at":"2026-08-07T12:19:37.114089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:36.865262Z","title":"McKinzie, Z","venue":null,"work_id":"94d05ff0-e0ba-49c9-9dd4-fe4514ee4a41","year":2024},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:30.866055Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:77ea911d6245c83a834eb6d4c3c643f49c45aff7d5f4c8f997fb734c91283172","observation_id":"07b05db5-4d96-4a24-883d-5afaf2c774c6","resolution":{"observed_at":"2026-08-07T12:19:36.939924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-03T02:02:15.325394Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-07T12:19:30.952675Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:30.952675Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:c1502099cc4b2a456da9955ef0edc68c24af1f65109f135673ed55b6115369d4","observation_id":"506e6805-bec1-42ef-8741-9021d8de2142","resolution":{"observed_at":"2026-08-07T12:19:30.952675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:31.018935Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:31.018935Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:3c03c46e657f92c76f24cea02f659269043f280dbed94cba0b8aa5016c7cce88","observation_id":"d96e84b5-90c7-418f-9cad-8895631444ce","resolution":{"observed_at":"2026-08-07T12:19:31.018935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:36.678392Z","title":"Cosmos-reason1: From physical common sense to embodied reasoning.ArXiv Preprint, 2025","venue":null,"work_id":"cd87474f-9e24-49df-bd05-17359fc0dfdc","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:31.104564Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:644cbcab5462ad6c18cd58a091833f9134558cfd9496de5741bbeb2937d2a1ce","observation_id":"1668b6b2-9509-45c9-b2d5-cbb91bfdbbfd","resolution":{"observed_at":"2026-08-07T12:19:36.771630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:19:31.205359Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:31.205359Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:27f0b9ec82723fc3e607ac9ba021559244ce17ddef90d53cca6ccfa1dafa4cf9","observation_id":"36adb5f2-e95f-483b-895a-81d9efcd6413","resolution":{"observed_at":"2026-08-07T12:19:31.205359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T12:19:31.310445Z","title":"Ouyang, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:31.310445Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:04bd8382c0e1c1031dcd8039ec7e4eb6a5eda6e2d4a899c34cb3642a31650b3c","observation_id":"b2b5241e-a48c-4c92-bda0-a3b0c03496aa","resolution":{"observed_at":"2026-08-07T12:19:31.310445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:36.546391Z","title":"Ouyang, J","venue":null,"work_id":"56736a47-f0a9-432a-9dd2-02a4ec60b4a3","year":2022},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:31.380667Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:58c54b15adcb97448720480c4c578c5f5cb62c43873641b77ac1bdfa75be8df0","observation_id":"4e7f3f0e-9d5a-45c9-8842-d72f6ed6f0ca","resolution":{"observed_at":"2026-08-07T12:19:36.611155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:36.334280Z","title":"Peng, Chris, X","venue":null,"work_id":"393a754a-dbf1-4cd1-aa42-49aeb0dd7679","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:31.502640Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:aa27c2a61744d21a22b541d0bc2515d37c6ecc512d64f079f21cba76e34f6a0b","observation_id":"05f165ac-e7f8-4847-bc0f-9120a054e969","resolution":{"observed_at":"2026-08-07T12:19:36.437611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:31.625386Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:31.625386Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:adf59b281284b0b106abf2649075b1f6ea30f36134c7244170f9adaea3e4d44d","observation_id":"1d5b4da2-473d-4f1a-90e3-d6c1dc18299a","resolution":{"observed_at":"2026-08-07T12:19:31.625386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-07T12:19:31.738904Z","title":"Rafailov, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:31.738904Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:658e8e089dcdf537cc07b127a6511430b37a7ea352e3c9f2d9bded8359284da9","observation_id":"cbc401ff-1088-4f68-a918-586d04aee518","resolution":{"observed_at":"2026-08-07T12:19:31.738904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:36.148864Z","title":null,"venue":null,"work_id":"9d547a66-766f-4c0a-8144-0b62d0458ee8","year":2024},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:31.793444Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:560078d2f6cdea3c24b007493e86966c36af7a387b98d9d88ca1e4758c2b2507","observation_id":"dd62f111-703f-48e8-8adc-cfc620dd31ba","resolution":{"observed_at":"2026-08-07T12:19:36.227187Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.08731","last_updated":"2020-04-02T05:40:29Z","snapshot_observed_at":"2026-08-02T19:28:48.954133Z","submitted_at":"2019-11-20T06:43:41Z","title":"Distributionally Robust Neural Networks for Group Shifts: On the Importance of Regularization for Worst-Case Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.08731","snapshot_observed_at":"2026-08-07T12:19:31.901276Z","title":"Sagawa, P","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:31.901276Z"},"links":{"cited_paper":"/paper/1911.08731","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:d56a3b063729d3fcced8599e070b47da96bae6a2460adc14ca963ee22c0a83d5","observation_id":"befcf928-f64e-4cd1-a5d8-aeab00ba624a","resolution":{"observed_at":"2026-08-07T12:19:31.901276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:19:32.007792Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:32.007792Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:7a650e8ca62fdaa1c95b4d2d1afaffa345990ea99d1b18fb70ac43b7efb62143","observation_id":"9f92bc84-026a-4511-8e3a-6714df7829dd","resolution":{"observed_at":"2026-08-07T12:19:32.007792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T12:19:32.059007Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:32.059007Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:c9c7f29a3b4cf2784628d257c83ce75181aa87025b340d32e10aa3841382772d","observation_id":"5ef0fab3-046a-4843-8f4d-86c506c1ef34","resolution":{"observed_at":"2026-08-07T12:19:32.059007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T12:19:32.177573Z","title":"Sheng, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:32.177573Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:74af5135ad1395494019d516832f02e4bb8221326c4e231832bdef37520a4867","observation_id":"367cc09a-05af-44dc-b842-ae928ee91792","resolution":{"observed_at":"2026-08-07T12:19:32.177573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:36.006066Z","title":null,"venue":null,"work_id":"f4786283-bff2-4b6c-bb5a-e77f19020cfe","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:32.290607Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:5695db9c575712d5a4ef51cb533706ad03853b6b39f84a4db721e040309347a6","observation_id":"be5e165c-dd85-497e-bbf7-d2e9b81ce38d","resolution":{"observed_at":"2026-08-07T12:19:36.088926Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-07T12:19:32.411773Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:32.411773Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:97ebf75a3d0008553a887522ca9b91393cd8d1c37a9e71a4b9a8a3d1e6a5aca2","observation_id":"230e477d-4ee5-4fb3-b729-95864a7ed00c","resolution":{"observed_at":"2026-08-07T12:19:32.411773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11839","last_updated":"2024-10-07T17:59:42Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:58Z","title":"mDPO: Conditional Preference Optimization for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11839","snapshot_observed_at":"2026-08-07T12:19:32.483603Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:32.483603Z"},"links":{"cited_paper":"/paper/2406.11839","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:1e8b34500a23627eba5e97c8e976606cc05f20532a7e94980c76880587e82085","observation_id":"a1fbe716-a90d-43ec-913a-c1820312abbb","resolution":{"observed_at":"2026-08-07T12:19:32.483603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:35.812477Z","title":null,"venue":null,"work_id":"6a8f6d8a-0c35-4370-886d-2d9089b6a2b4","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:32.601211Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:3d7d90efb62c6d5b5cadf164ff74831ac4d141f381bb445eca5bd994d79f42a4","observation_id":"be18043c-6a69-44e7-ab13-9d65bd318e31","resolution":{"observed_at":"2026-08-07T12:19:35.910101Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:35.644851Z","title":null,"venue":null,"work_id":"4948bc49-2438-4250-91bd-254a3ebfe980","year":2024},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:32.703789Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:4750a5ec3c829c3bdbf1b962bf9d85de0dc905ed8f13846f80972955b290e61c","observation_id":"78c93715-b0d7-4206-8442-5b4df4c41f82","resolution":{"observed_at":"2026-08-07T12:19:35.741748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:35.457732Z","title":null,"venue":null,"work_id":"ad99778a-e3b8-46af-9bd7-285ed686f293","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:32.784877Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:3f3fc9a6e1fc9cccc1cec94112cf489d0ecb46a504c8dcd822ffef17633d908e","observation_id":"0a2e5b54-9d8c-44b1-8f15-2467a0288201","resolution":{"observed_at":"2026-08-07T12:19:35.548938Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:35.319303Z","title":null,"venue":null,"work_id":"7e501c0b-854a-4739-9df1-85bfacde2cf9","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:32.887888Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:888578b4e9d8ec15b7f8721d30ec593166e20eb2ce9445da08b8b126fb5fa527","observation_id":"bfee1f25-fabd-44c0-bbf0-cec72525f06d","resolution":{"observed_at":"2026-08-07T12:19:35.363940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:33.002414Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:33.002414Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:12aaeb606acd205a35f00113bf05bf7a06c3c1754fc628b1c14cbd42ddc72db4","observation_id":"6984741f-9810-4566-8bd5-ca67811b28b8","resolution":{"observed_at":"2026-08-07T12:19:33.002414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19613","last_updated":"2025-02-26T23:01:16Z","snapshot_observed_at":"2026-08-07T17:44:42.205124Z","submitted_at":"2025-02-26T23:01:16Z","title":"Self-rewarding correction for mathematical reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19613","snapshot_observed_at":"2026-08-07T12:19:33.115481Z","title":"Xiong, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:33.115481Z"},"links":{"cited_paper":"/paper/2502.19613","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:11b64cf55bd97b257c5fc64062b9839b492782acfdf580848df83c44ca67c8b1","observation_id":"33f319fc-9290-4edf-ac9a-6f53d1eb7b31","resolution":{"observed_at":"2026-08-07T12:19:33.115481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:35.127001Z","title":null,"venue":null,"work_id":"af4efcfa-58fe-45f4-aba2-42d0bf6d85ac","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:33.199071Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:13a2bd55c692d949af40ed36b1034ddc728b42b99f8aac7047d3dac29a935e90","observation_id":"95606ce7-7304-4328-80ef-7b133816ede7","resolution":{"observed_at":"2026-08-07T12:19:35.209897Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:34.954677Z","title":null,"venue":null,"work_id":"e2ac2855-5004-4700-939a-2032aec6d867","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:33.304892Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:fef055525c6bd66588201df493b75dd83f3c3e59d1fbfab110a9b559431732aa","observation_id":"9013f422-4ac0-4f27-b3a5-ea5697626f87","resolution":{"observed_at":"2026-08-07T12:19:35.042683Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:34.803383Z","title":null,"venue":null,"work_id":"7faabb1e-6c81-46a1-bd32-a98151e38282","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:33.373216Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:bad962dfd0d380177dc82600812ef1094691f13866620231415a62d955275119","observation_id":"958484b5-336b-4ff0-83b4-8415090de637","resolution":{"observed_at":"2026-08-07T12:19:34.874529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-08-07T12:19:33.456884Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:33.456884Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:495c2444f48a44013b5192f54ab897169387247cba379efbb41b02e190e06b0f","observation_id":"191b6167-856d-46d8-9199-6fe42cb3ccd3","resolution":{"observed_at":"2026-08-07T12:19:33.456884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:34.687220Z","title":null,"venue":null,"work_id":"c9aa7565-1dd9-40bb-b5f7-ddae2a0dc85a","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:33.542724Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:f259299fd5626c1d5fe19d321cea6b28ea1978ed4befff0f035e89cb3f090e55","observation_id":"37e4bc21-49cf-45a0-91ef-ecf3b2449ca6","resolution":{"observed_at":"2026-08-07T12:19:34.736096Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:34.522137Z","title":null,"venue":null,"work_id":"a0d49b65-611f-4580-85de-bbe53091ae99","year":2024},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:33.618438Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:2d0b68cbc53ae59ee84b4800d0b0ce2f597c3a95f40f2ed36ce7084e6c3bd540","observation_id":"180fd3ef-1eda-4c11-8770-d40abbb02e9f","resolution":{"observed_at":"2026-08-07T12:19:34.617344Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:34.392190Z","title":null,"venue":null,"work_id":"bc5d2245-7fb0-4d36-8da3-fd7a43973572","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:33.724474Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:09e608df7b2eefc97a4da22938ec5a5ce20b9b5c5484a72f6376cd51045ec0a8","observation_id":"19b5ab88-062e-4050-8a5e-838e1cfe7b40","resolution":{"observed_at":"2026-08-07T12:19:34.446814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T12:19:33.786626Z","title":"Zhang, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:33.786626Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:6ae3e2b6f57fef8be7284156e770d644279027772c373a2deb9a5d1b522d3417","observation_id":"743b0234-2b6f-4c89-a45c-ca3607796007","resolution":{"observed_at":"2026-08-07T12:19:33.786626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3450.4393","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:34.010021Z","title":"aha moment","venue":null,"work_id":"1fb11ee5-0088-448d-8f84-f6aa2b561d1e","year":2025},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:33.840820Z"},"links":{"citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:1e950b17a544348c671dd7bf5f0b4388001032c8eed1f3d89e60325cbd3ca348","observation_id":"d5f4adcc-7c7e-4cf0-9684-045d4fbe4511","resolution":{"observed_at":"2026-08-07T12:19:34.067032Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 5 inbound Pith citation observations for arXiv:2505.24871."}