{"as_of":"2026-08-21T02:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6370675f608ac75e2ae52a8019ed94f678355cdb5265d9ed30d80c8e099b281d","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:53:27.275816Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T22:36:08.089323Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:39:51.505020Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23380","snapshot_observed_at":"2026-08-04T22:36:08.089323Z","title":"Unirl: Self-improving unified multimodal models via supervised and reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-14T21:31:53.057652Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T22:36:08.089323Z"},"links":{"cited_paper":"/paper/2505.23380","citing_paper":"/paper/2509.07295"},"observation_digest":"sha256:1f7f7a9474dc21b28bbf25ac46161e1e174bedd38c86db9e6b20f84ce0a02b3c","observation_id":"c63afbc4-b1d7-43af-ba5c-dc92b302b53b","resolution":{"observed_at":"2026-08-04T22:36:08.089323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23380","snapshot_observed_at":"2026-08-04T09:54:26.172394Z","title":"Unirl: Self-improving unified multimodal models via supervised and reinforcement learning.arXiv preprint arXiv:2505.23380,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-14T14:23:49.598555Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.172394Z"},"links":{"cited_paper":"/paper/2505.23380","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:4a798d8b759a9aa28448aba408b80ca7f15258811d90ec0d8060a8d13fd3a945","observation_id":"1b38343b-63f0-4da6-9d9e-c2958e2738fb","resolution":{"observed_at":"2026-08-04T09:54:26.172394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.23380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23380","snapshot_observed_at":"2026-07-04T13:39:51.505020Z","title":"Unirl: Self-improving unified multimodal models via supervised and reinforcement learning","venue":null,"work_id":"45fe8933-9a24-43fb-b001-d9a56ef24e8d","year":2025},"citing_paper":{"arxiv_id":"2605.17766","last_updated":"2026-05-18T02:35:05Z","snapshot_observed_at":"2026-08-14T10:08:29.810470Z","submitted_at":"2026-05-18T02:35:05Z","title":"LatentUMM: Dual Latent Alignment for Unified Multimodal Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T12:39:28.058049Z"},"links":{"cited_paper":"/paper/2505.23380","citing_paper":"/paper/2605.17766"},"observation_digest":"sha256:35c41143950407c248d688ad31ee59ad164bebd15ec6d52876179fa124b849f9","observation_id":"f65b3710-3e23-49d2-92cc-c271d97ff38f","resolution":{"observed_at":"2026-05-20T12:43:17.438705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.23380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23380","snapshot_observed_at":"2026-07-04T13:39:51.505020Z","title":"Unirl: Self-improving unified multimodal models via supervised and reinforcement learning","venue":null,"work_id":"45fe8933-9a24-43fb-b001-d9a56ef24e8d","year":2025},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":195,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2505.23380","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:46788739abefd224e1934854ef80033ff8731f3863fa5832f76c5821f92f1817","observation_id":"d3fe3d45-ba2a-4eb6-98ba-c8dccb1f69d1","resolution":{"observed_at":"2026-06-29T23:04:01.711658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.23380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23380","snapshot_observed_at":"2026-07-04T13:39:51.505020Z","title":"Unirl: Self-improving unified multimodal models via supervised and reinforcement learning","venue":null,"work_id":"45fe8933-9a24-43fb-b001-d9a56ef24e8d","year":2025},"citing_paper":{"arxiv_id":"2606.27376","last_updated":"2026-06-25T17:59:57Z","snapshot_observed_at":"2026-08-13T08:13:11.519782Z","submitted_at":"2026-06-25T17:59:57Z","title":"Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T04:58:15.891214Z"},"links":{"cited_paper":"/paper/2505.23380","citing_paper":"/paper/2606.27376"},"observation_digest":"sha256:71b2f0d87a2a7c28f0e525023982a24f315be5f63891b6aa4123702db16650f0","observation_id":"a4bd0c27-f7ff-4223-9366-d8b551a7fab2","resolution":{"observed_at":"2026-07-04T13:39:51.506849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23380","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Unirl: Self-improving unified multimodal models via supervised and reinforcement learning.arXiv preprint arXiv:2505.23380, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2505.23380","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:85a70d17466b04cbb00a7b781b5b81ce2bda6ffa3e5cd40289e05aafb75e66d5","observation_id":"75fc4684-086d-4358-8cb7-ba8102369c62","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23380","snapshot_observed_at":"2026-08-01T18:56:58.185926Z","title":"Unirl: Self-improving unified multimodal models via supervised and reinforcement learning.arXiv preprint arXiv:2505.23380, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-21T01:06:41.475390Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:58.185926Z"},"links":{"cited_paper":"/paper/2505.23380","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:d7b06ad3885c9f46803b76406dad111ea35e84482b909f0e78c9da6a76e53260","observation_id":"a2b02145-2d74-4af7-b2cf-57e6af75cced","resolution":{"observed_at":"2026-08-01T18:56:58.185926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23380/citation-record","integrity":"/paper/2505.23380/integrity","json":"/paper/2505.23380/citation-record.json","paper":"/paper/2505.23380"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T12:53:21.247048Z","title":"Phi-3 technical re- port: A highly capable language model locally on your phone.arXiv preprint arXiv:2404.14219, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:21.247048Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:499df2c453928bf428ef8cef001d69e7aa1ff4406bd90130607fd9ecb2bfdd5a","observation_id":"aec5fbc9-7aeb-4bbe-a4ec-b481b7096a02","resolution":{"observed_at":"2026-08-07T12:53:21.247048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T12:53:21.392275Z","title":"Gemini: A family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 1, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:21.392275Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:0cd08d3f89d92a3a975a4fd77842819cda0c5e66f23bd0f4462cd2ae26dbd6df","observation_id":"58bb2215-a757-4c2a-965b-9064c404f0fa","resolution":{"observed_at":"2026-08-07T12:53:21.392275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T12:53:21.498548Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.CoRR, abs/2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:21.498548Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:9b290b5d0d1fc8ab7711daae3ac745114e87c0661e820a5344527524840adcd7","observation_id":"b548974f-40f1-47cd-8543-216fa5d1fe4e","resolution":{"observed_at":"2026-08-07T12:53:21.498548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-16T22:33:00.173650Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-07T12:53:21.647902Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models.arXiv preprint arXiv:2504.11468, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:21.647902Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:16312501f96d9e992ef4f63f4c53a22a12b18e85b1a88dced2aa707d21c0afef","observation_id":"de27a906-4d36-4c4a-a3db-7a66dbc3c57d","resolution":{"observed_at":"2026-08-07T12:53:21.647902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07155","last_updated":"2019-06-17T17:58:12Z","snapshot_observed_at":"2026-08-16T03:32:25.570081Z","submitted_at":"2019-06-17T17:58:12Z","title":"MMDetection: Open MMLab Detection Toolbox and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.07155","snapshot_observed_at":"2026-08-07T12:53:21.803824Z","title":"Mmdetection: Open mmlab detection toolbox and benchmark.CoRR, abs/1906.07155, 2019","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:21.803824Z"},"links":{"cited_paper":"/paper/1906.07155","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:29f8c168cb3e37fc7dedf83c1171c9293c04ae17ce28a56ba664d7b2c8252eeb","observation_id":"5188efac-6b8d-4830-88d7-73269d8607d5","resolution":{"observed_at":"2026-08-07T12:53:21.803824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T12:53:21.903111Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling.CoRR, abs/2501.17811, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:21.903111Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:f2102e028b295c45a439ca3e9ea1cf319c0b3f59cfc5fc42b8bc2e91d22571d2","observation_id":"451f3035-a90e-470e-9aec-921385dd5ba2","resolution":{"observed_at":"2026-08-07T12:53:21.903111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:30.784289Z","title":"Schwing, Alexander Kirillov, and Rohit Girdhar","venue":null,"work_id":"4f8af2a3-08bc-4637-a8c2-2bfe5826f18f","year":null},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:21.990830Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:895726b11e18d2f0ebd7a42560ba14029dea8fe0b537c0d0b4d85430f6c85225","observation_id":"20b0f5b4-8f58-44e8-a842-3f91de0cca06","resolution":{"observed_at":"2026-08-07T12:53:30.932772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:30.542803Z","title":"Baldridge, Roopal Garg, Peter Anderson, Ranjay Krishna, Mohit Bansal, Jordi Pont-Tuset, and Su Wang","venue":null,"work_id":"40dd8f16-76ba-4255-87f9-35ebe2438c9b","year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:22.106661Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:758f82cc3107e885dbf6c583d9bd805e55e12fc9bf601f20ef36804e30850716","observation_id":"dd42ec44-cf96-4338-868e-c364240aa56b","resolution":{"observed_at":"2026-08-07T12:53:30.653559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T12:53:22.203748Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:22.203748Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:14d05f2902dc5a84245b45cdd09f94a530e20ff8cf8115b5b8459c79601d3a62","observation_id":"9dc2eece-21b3-4a7d-a269-9cd6afc167cb","resolution":{"observed_at":"2026-08-07T12:53:22.203748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:22.295884Z","title":"DreamLLM: Synergistic multimodal comprehension and creation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:22.295884Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:47f198008b10eaed9510f049f37aa0265ac7e16b3b1d89f6b60b23b9f8b453e5","observation_id":"b9db14ca-f33c-4c9c-a4ac-1bcc3f660906","resolution":{"observed_at":"2026-08-07T12:53:22.295884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:30.241990Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"97925e52-79f3-42c2-9196-16523414079f","year":2021},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:22.391653Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:f239b61a55d1aeeed773977cee3f61513ee0a8c04ead5de7f2c65613d978aa7e","observation_id":"c8db548b-d4fe-41f3-a841-c5bd44d5cf05","resolution":{"observed_at":"2026-08-07T12:53:30.410352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:29.995099Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"a122db7a-38bd-45e9-bff3-2b918c92cc72","year":2021},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:22.481332Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:3ea228d07db1b8f02110e96d31fee6efef79168074cb5b10add855d031341ce7","observation_id":"ba29a64c-395e-4fe1-afd7-b2d004a890d3","resolution":{"observed_at":"2026-08-07T12:53:30.134836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-07T12:53:22.622402Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation.arXiv preprint arXiv:2404.14396, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:22.622402Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:2702099f1f1e2e71f365afc2b8c014a55387d1ba1fbe38647790188358a2c9bc","observation_id":"66ebf948-5046-4075-86b9-878955536ed3","resolution":{"observed_at":"2026-08-07T12:53:22.622402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:22.801107Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:22.801107Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:35d3c1a2a2e5b26253fe3be6500d5064b51bc772a5fbb2343a004462b093477e","observation_id":"018ec1df-5998-4250-a5a9-2177b76fca32","resolution":{"observed_at":"2026-08-07T12:53:22.801107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-08-19T17:50:55.743272Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-08-07T12:53:22.895103Z","title":"Can we generate images with cot? let’s verify and reinforce image generation step by step.CoRR, abs/2501.13926, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:22.895103Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:a145021e6e91dc7d0f1845a4c72b239500085489a473477f6e8e44db53c2a4d5","observation_id":"3e8053ea-4c2d-445e-aebf-e7b2b1ee8a09","resolution":{"observed_at":"2026-08-07T12:53:22.895103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T12:53:23.010341Z","title":"Openai o1 system card.CoRR, abs/2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.010341Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:01b7ede66f83db4979782ba7b6ffdde469e1b1f676aff8e70e49f3d238f79e5b","observation_id":"9b0265b6-958f-4093-95cd-96faa8adc758","resolution":{"observed_at":"2026-08-07T12:53:23.010341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00127","last_updated":"2025-04-16T10:04:24Z","snapshot_observed_at":"2026-08-20T00:33:26.485447Z","submitted_at":"2024-11-28T13:00:38Z","title":"Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific Heads","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00127","snapshot_observed_at":"2026-08-07T12:53:23.148041Z","title":"Orthus: Autoregressive interleaved image-text generation with modality-specific heads.CoRR, abs/2412.00127, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.148041Z"},"links":{"cited_paper":"/paper/2412.00127","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:237384a94c91437f3132bc931532c429a66c55e723ba678314958bbefffa8d0a","observation_id":"668be6c0-d07f-4c16-b854-b3f4c42bb6ef","resolution":{"observed_at":"2026-08-07T12:53:23.148041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07542","last_updated":"2025-01-13T18:23:57Z","snapshot_observed_at":"2026-08-17T08:25:34.071490Z","submitted_at":"2025-01-13T18:23:57Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07542","snapshot_observed_at":"2026-08-07T12:53:23.280824Z","title":"Imagine while reasoning in space: Multimodal visualization-of-thought.CoRR, abs/2501.07542, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.280824Z"},"links":{"cited_paper":"/paper/2501.07542","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:527b8fa33894e68f13ee600497f3b96aad243f80fb1f7d13bf5ad6e6adb60d2a","observation_id":"2c634cf9-a721-40d5-8aac-613f2429c5f9","resolution":{"observed_at":"2026-08-07T12:53:23.280824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","snapshot_observed_at":"2026-08-16T05:48:44.789665Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09604","snapshot_observed_at":"2026-08-07T12:53:23.378411Z","title":"Synergen-vl: Towards synergistic image understanding and generation with vision experts and token folding.CoRR, abs/2412.09604, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.378411Z"},"links":{"cited_paper":"/paper/2412.09604","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:16b08ff5b4cdd03d198d755860b46df92996063c7ede469bd1023c92c82012c3","observation_id":"d4fa1d2f-af8a-4a60-aea4-08ba69542773","resolution":{"observed_at":"2026-08-07T12:53:23.378411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01169","snapshot_observed_at":"2026-08-07T12:53:23.481480Z","title":"Omniflow: Any-to-any generation with multi-modal rectified flows","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.481480Z"},"links":{"cited_paper":"/paper/2412.01169","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:32de2d3d717f2b541e9cbcac5a9b8d9c67e8c6aff4735b8d3d337d3baaf5f5af","observation_id":"43be3b75-d5fa-411d-a840-991ebc006b4b","resolution":{"observed_at":"2026-08-07T12:53:23.481480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:29.765663Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"827f0b95-f5cb-434b-94f2-5bbb3a8d2fc4","year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.546372Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:a7cacd381b3f58362d280ff67852c6f7786c1fec3f2e4656158d601e9bdc2e2e","observation_id":"2e9ad2e1-f710-4333-9696-fce27c100765","resolution":{"observed_at":"2026-08-07T12:53:29.928449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05463","last_updated":"2023-09-11T14:01:45Z","snapshot_observed_at":"2026-08-02T22:47:03.212781Z","submitted_at":"2023-09-11T14:01:45Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05463","snapshot_observed_at":"2026-08-07T12:53:23.636560Z","title":"Textbooks are all you need ii: phi-1.5 technical report.arXiv preprint arXiv:2309.05463, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.636560Z"},"links":{"cited_paper":"/paper/2309.05463","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:df5e20526b112e3dc55329ca3148cd5469fdc759a2e2a0143a87f239006dd6ea","observation_id":"fc666632-e083-4888-866b-1ae50628efdb","resolution":{"observed_at":"2026-08-07T12:53:23.636560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-20T06:14:05.136628Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-07T12:53:23.757213Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining.CoRR, abs/2408.02657, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.757213Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:67f6c3064559ebb5eb70c0be914331c0e91cc9f6ed00971c5e9d075a5744b02a","observation_id":"c72fe73b-cab8-499d-8243-8f62cb7fce89","resolution":{"observed_at":"2026-08-07T12:53:23.757213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:23.884539Z","title":"World model on million-length video and language with ringattention.arXiv preprint, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.884539Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:a3e1a40b3238631b1be79bc39c746de5d95cb58fadfad20ff99479349a6d13cd","observation_id":"51de8089-3bda-4734-b1ce-cfd61af89862","resolution":{"observed_at":"2026-08-07T12:53:23.884539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:24.079598Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:24.079598Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:908ed64ddba21f7faecc8715b62cec3dcac67953d468c79f260a642617b04ffb","observation_id":"ef2e40da-f413-46e3-91e8-cafa6f0483eb","resolution":{"observed_at":"2026-08-07T12:53:24.079598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:24.253921Z","title":"Visual instruction tuning.NeurIPS, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:24.253921Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:d486675d2d4c35b8d0a9b1b127fcaab4c1ef824e626da44846044395bc79ea4e","observation_id":"cd8acce9-ac40-4322-a4be-1e017b220653","resolution":{"observed_at":"2026-08-07T12:53:24.253921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07975","last_updated":"2025-03-24T08:33:32Z","snapshot_observed_at":"2026-08-19T14:16:58.804962Z","submitted_at":"2024-11-12T17:55:10Z","title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07975","snapshot_observed_at":"2026-08-07T12:53:24.426795Z","title":"Janusflow: Harmonizing autoregres- sion and rectified flow for unified multimodal understanding and generation.arXiv preprint arXiv:2411.07975, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:24.426795Z"},"links":{"cited_paper":"/paper/2411.07975","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:3c1a944f462f3c2beb01437933c12670945b1350cddf593201a7908b5844e7cf","observation_id":"f7a0385d-c4bf-4561-aeb5-f7d4665e6dd0","resolution":{"observed_at":"2026-08-07T12:53:24.426795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-17T23:54:49.013871Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06474","snapshot_observed_at":"2026-08-07T12:53:24.588515Z","title":"Unimod: Efficient unified multimodal transformers with mixture-of-depths.CoRR, abs/2502.06474, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:24.588515Z"},"links":{"cited_paper":"/paper/2502.06474","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:393966b63c6c932a8037e4f9b517078f6adae84e8d3a300c6ff7fd20ae747ac4","observation_id":"abbcd6f8-fb9e-4226-bd62-53b52b9d3f5c","resolution":{"observed_at":"2026-08-07T12:53:24.588515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-08-15T18:07:41.591747Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-07T12:53:24.689189Z","title":"Du, Zehuan Yuan, and Xinglong Wu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:24.689189Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:03bbf86bc30e57e13b7e007e0c1852d68239fa0e57cded7aa5148634d649f5df","observation_id":"8ed1468c-7cf9-4a0c-b1c7-8dcfafffb433","resolution":{"observed_at":"2026-08-07T12:53:24.689189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:28.666064Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"e39bf80f-806b-4a7f-b3bb-7ceb8457b784","year":2021},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:24.823422Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:b31136b6f36177a3e6b141fd9fe8ed96426934d6e4617d6b5a95d4cd46f124c9","observation_id":"f7ab2202-5522-41f1-b062-d5223aef3e5a","resolution":{"observed_at":"2026-08-07T12:53:29.228511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:25.018029Z","title":"Manning, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:25.018029Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:c9d3b2f2c2fceeacdd74c66c539f2971bc05a47e024f1cd8c2ec62075d27e12d","observation_id":"dc850bae-8438-49fc-b1eb-d0faf2e5271d","resolution":{"observed_at":"2026-08-07T12:53:25.018029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T12:53:25.202348Z","title":"Proximal policy optimization algorithms.CoRR, abs/1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:25.202348Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:cd591ef247dcba1b8122c1c31cf8ec2d97fdcd04b97b78dd0a76be5eb43f0f99","observation_id":"971cb1b3-6d1f-49e9-bc2e-e50d243c1c7d","resolution":{"observed_at":"2026-08-07T12:53:25.202348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:53:25.336876Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:25.336876Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:5018501eb6a4a511160f046cf61dae2edcd9e368a8867a26f12912bad063812f","observation_id":"62ac2f3a-ce0f-4374-8b79-36b0b4b1a2de","resolution":{"observed_at":"2026-08-07T12:53:25.336876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-17T03:15:27.866249Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-07T12:53:25.463377Z","title":"Llamafusion: Adapting pretrained language models for multimodal generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:25.463377Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:deb2747fec4ac560a7787ef650c0947f5f700f42f9c04f5911b0e2977bc082d0","observation_id":"05dac12b-2ec1-4114-b49e-baa9bdda25cf","resolution":{"observed_at":"2026-08-07T12:53:25.463377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:25.595623Z","title":"Journeydb: A benchmark for generative image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:25.595623Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:1d2e006f3c5f9750169e480af7b02e8f6b466152de11c3a8a67c1c687474ceae","observation_id":"2b70c008-595a-485d-b86a-263d5d806029","resolution":{"observed_at":"2026-08-07T12:53:25.595623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:25.723242Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:25.723242Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:bf3ba2ca52de22a47ea1a8a7fd41e2effdb6ac5f78f38a7d8347673087029d55","observation_id":"16b7d5a9-ffd4-40e9-a283-5569a2b83d4b","resolution":{"observed_at":"2026-08-07T12:53:25.723242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:25.798707Z","title":"Any-to-any generation via composable diffusion.NeurIPS, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:25.798707Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:c64fee6af25531c61fdf4b909aabde3b8382aa67db72507f3d1ff9561f975ca9","observation_id":"2a227863-0077-490b-81b3-7e8ae235e776","resolution":{"observed_at":"2026-08-07T12:53:25.798707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T12:53:25.864139Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:25.864139Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:399775d43100ff41dc80c64930be5f5edd04d8181cb86181d79db2209a66132d","observation_id":"de4c8042-f473-4ec0-be7e-fa036b0c4a4a","resolution":{"observed_at":"2026-08-07T12:53:25.864139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-17T07:24:03.168446Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-07T12:53:25.933048Z","title":"Metamorph: Multimodal under- standing and generation via instruction tuning.arXiv preprint arXiv:2412.14164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:25.933048Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:e6a8407f116931a0f7535e1f6244619a5599727c009dba122498f9ce8296fc2e","observation_id":"bc8082fa-ff6c-40a4-86de-58673450e2ed","resolution":{"observed_at":"2026-08-07T12:53:25.933048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:53:26.025472Z","title":"Llama: Open and efficient foundation language models.CoRR, abs/2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:26.025472Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:6da3d78629471a7fc1fd0b5382ad1eefb75aa6f1b1dc744c6d73cf0c9e1de6aa","observation_id":"c9438d87-f325-472f-852a-a530122fe4ab","resolution":{"observed_at":"2026-08-07T12:53:26.025472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T12:53:26.121878Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:26.121878Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:21b46e0b8803e85354b485d0351450afcdcf9de38403b9c8b5f2ea8537b2c2f8","observation_id":"cbde4961-f1a8-460f-a1a2-23d466d71dd6","resolution":{"observed_at":"2026-08-07T12:53:26.121878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-07T12:53:26.245919Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation.CoRR, abs/2410.13848, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:26.245919Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:7cf8fadc8232a78a1fb21fce47ffc5c023b52697ba5f1c1185c2986cfe66b1aa","observation_id":"3b1f686e-b87c-4b9a-a8fa-b6dced2d1622","resolution":{"observed_at":"2026-08-07T12:53:26.245919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-19T20:11:01.764633Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-07T12:53:26.366317Z","title":"Liquid: Language models are scalable multi-modal generators.CoRR, abs/2412.04332, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:26.366317Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:fd30fdeb844c577cfb532e52b2185083a585cc71a402b9b092229a162a2f5173","observation_id":"e308dcb7-501d-44bf-9a0f-d4708432b45f","resolution":{"observed_at":"2026-08-07T12:53:26.366317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-17T09:50:53.260956Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-07T12:53:26.460651Z","title":"Next-gpt: Any-to-any multimodal llm.arXiv preprint arXiv:2309.05519, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:26.460651Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:d403003684b78b4ae1222aacf8a25bb2ef2dd8a6f7dc816fa26347881ca44795","observation_id":"727c3c1d-52ce-4d27-bf43-8b46fbc2fb7f","resolution":{"observed_at":"2026-08-07T12:53:26.460651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-07T12:53:26.558833Z","title":"VILA-U: a unified foundation model integrating visual understanding and generation.CoRR, abs/2409.04429, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:26.558833Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:e0297b4b2a3080f2a6983f4948cb9dcfc4243e3bf26ee58fb3f96a4905fbd175","observation_id":"fd41ded9-b835-43de-a77e-0011efa915fc","resolution":{"observed_at":"2026-08-07T12:53:26.558833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-08-18T17:34:44.890427Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T12:53:26.689185Z","title":"Show-o: One single trans- former to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:26.689185Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:9a581e8d283ba6c1409fde10d2e45b45bb7ad5e930dd3d2a31620202019b5546","observation_id":"4c66c372-c2ee-43d4-9d91-34869edf7d61","resolution":{"observed_at":"2026-08-07T12:53:26.689185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-08-17T05:35:17.658314Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-07T12:53:26.847399Z","title":"Qwen2.5-1m technical report.CoRR, abs/2501.15383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:26.847399Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:c54163f5bd19b1b1ca1322c57e017aae44325001c58e5b03f1545954d4cb8845","observation_id":"17d2601d-6d50-4659-876f-f6998775a666","resolution":{"observed_at":"2026-08-07T12:53:26.847399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:26.974393Z","title":"Hermesflow: Seamlessly closing the gap in multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:26.974393Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:da134f8bce16004b5ca814edbafd53bb6ddfdbe78325da8404292a1a2cf43ae2","observation_id":"34296fd0-0dcc-4c8b-b655-9991d86c2266","resolution":{"observed_at":"2026-08-07T12:53:26.974393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:53:27.100136Z","title":"MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for expert AGI","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:27.100136Z"},"links":{"citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:4017c503b98fe1d35031585ec3c57ded123fe9597b9c4dac4d891e54b9cf8be7","observation_id":"598112ee-2156-417e-9f68-063ebb26669d","resolution":{"observed_at":"2026-08-07T12:53:27.100136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03651","last_updated":"2025-03-05T16:26:58Z","snapshot_observed_at":"2026-08-16T12:52:47.669199Z","submitted_at":"2025-03-05T16:26:58Z","title":"DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal Cycles","version":1},"cited_work":{"arxiv_id":"2503.03651","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.03651","snapshot_observed_at":"2026-08-07T12:53:27.544486Z","title":"DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal Cycles","venue":"cs.CV","work_id":"58b6f6c8-458d-4dee-925c-4c2830cbc075","year":2025},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:27.204685Z"},"links":{"cited_paper":"/paper/2503.03651","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:d93665c3e7f358f094bb549f7232e43e1af7ac661acec405c3761b0662c92485","observation_id":"1266f9e7-3c5b-4c78-baf3-94b4c1da3891","resolution":{"observed_at":"2026-08-07T12:53:27.611095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-19T12:50:53.888784Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-07T12:53:27.275816Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model.CoRR, abs/2408.11039, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:27.275816Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:dc6e388b080dacb10b86a52c81acb3aa711d4a4f13a2a06a6a40bdd4a0ff251d","observation_id":"b7ac9371-df22-4361-af2c-b5731326aa0e","resolution":{"observed_at":"2026-08-07T12:53:27.275816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":1,"verified_fuzzy":6},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 7 inbound Pith citation observations for arXiv:2505.23380."}