{"as_of":"2026-08-12T09:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ede75a742d6235df776af2bd0da7bac2cb1932dc039400a226a5b8867c20f3fd","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:44:18.590800Z","state":"measured"},{"denominator":99,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":99,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:37:16.161813Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:39:58.237442Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T16:24:27.407376Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2503.07265"},"observation_digest":"sha256:612f8bb9ec08a39e707af99e69d805022f04888e37039833c943bcef17faa288","observation_id":"6b93d0b8-5e55-41ec-8c49-81e8ff292d4f","resolution":{"observed_at":"2026-05-15T16:24:27.498867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-08-06T04:37:16.161813Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03320","last_updated":"2025-08-05T10:59:01Z","snapshot_observed_at":"2026-08-11T14:23:23.407391Z","submitted_at":"2025-08-05T10:59:01Z","title":"Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T04:37:16.161813Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2508.03320"},"observation_digest":"sha256:66ce0449240c3330c67091368bb846c34a277857f5559f041635c8757fdec53b","observation_id":"2440898c-8e79-4572-8e74-09e812db5517","resolution":{"observed_at":"2026-08-06T04:37:16.161813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2509.01986","last_updated":"2026-04-08T07:45:08Z","snapshot_observed_at":"2026-07-06T22:22:03.439592Z","submitted_at":"2025-09-02T06:06:52Z","title":"Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T20:04:00.773443Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2509.01986"},"observation_digest":"sha256:816a4ebaa74cf47e33a066506901c9420de474d9dd70f2f24de8854561e48686","observation_id":"e6e71b26-80af-437d-8272-7790425ea856","resolution":{"observed_at":"2026-05-18T20:06:50.057017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-08-04T22:36:08.243005Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-04T22:36:03.033298Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-04T22:36:08.243005Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2509.07295"},"observation_digest":"sha256:3c603c882834ed6fee16dee7c91bf4d08c6b32cea2c0e0570f43f21c49915137","observation_id":"2dd93c32-9928-4ffc-a9d7-b37b27e91874","resolution":{"observed_at":"2026-08-04T22:36:08.243005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-08-03T07:03:14.264753Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.21406","last_updated":"2026-05-25T11:24:48Z","snapshot_observed_at":"2026-08-03T07:03:10.947402Z","submitted_at":"2026-01-29T08:42:25Z","title":"Generation Enhances Understanding in Unified Multimodal Models via Multi-Representation Generation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T07:03:14.264753Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2601.21406"},"observation_digest":"sha256:0a42910d92dac834078006a04a83c93060e3a5a3fc8d9aaa908d30c1380d8997","observation_id":"1120e7a6-8acc-4195-9c58-944c4448e8fa","resolution":{"observed_at":"2026-08-03T07:03:14.264753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:d50d29dc059fd73f0076a286bfdc11213318d3ed8a71052185c41c63a4b5650b","observation_id":"21aa7041-6a31-430c-b826-375928f15e2f","resolution":{"observed_at":"2026-05-16T08:10:45.393690Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-12T22:22:06.385856Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10783","last_updated":"2026-05-25T13:18:36Z","snapshot_observed_at":"2026-07-12T22:21:23.393919Z","submitted_at":"2026-04-12T19:18:02Z","title":"Learning Preference-Based Objectives from Clinical Narratives for Dynamic Sepsis Treatment","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T22:22:06.385856Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2604.10783"},"observation_digest":"sha256:3d49a1c5c93d9fa8f71b71386762b99c001b5de348850e74b027986f3afd042b","observation_id":"c3b208eb-af74-4035-9ed4-2c9adbb461d9","resolution":{"observed_at":"2026-07-12T22:22:06.385856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2604.10784","last_updated":"2026-05-19T19:12:18Z","snapshot_observed_at":"2026-08-11T09:55:17.776939Z","submitted_at":"2026-04-12T19:19:04Z","title":"TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T15:32:01.551829Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2604.10784"},"observation_digest":"sha256:feb9d2c547aa9eb5ca1613b53690ce8c072b85b82276c00be1b3df3a6f822c02","observation_id":"85e93ea3-9f3f-415a-aa55-0158c10054e5","resolution":{"observed_at":"2026-05-11T10:21:03.172221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2604.10784","last_updated":"2026-05-19T19:12:18Z","snapshot_observed_at":"2026-08-11T09:55:17.776939Z","submitted_at":"2026-04-12T19:19:04Z","title":"TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T08:59:10.877437Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2604.10784"},"observation_digest":"sha256:6128e219d6656e69126e02f48a6082793bc9a2090b6866c1fbae2bcdf01d7c08","observation_id":"5b0f89c4-257c-4a73-a01f-98ebefdd4451","resolution":{"observed_at":"2026-05-21T08:59:55.268707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-08-11T06:08:34.967071Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:c60ef27e494bbfbdb880a7699a894ca222f226a219880b220563d58cc7728860","observation_id":"c96aa05d-13c8-4ef0-88af-bcbcf5319edf","resolution":{"observed_at":"2026-05-10T09:28:39.580506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2604.19954","last_updated":"2026-04-21T20:01:38Z","snapshot_observed_at":"2026-08-08T21:35:14.408066Z","submitted_at":"2026-04-21T20:01:38Z","title":"Camera Control for Text-to-Image Generation via Learning Viewpoint Tokens","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T02:58:03.974053Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2604.19954"},"observation_digest":"sha256:f4b7496152782dfbcb74610fee95a9f7fa2fbc2f2879f769d34b23952c9feca6","observation_id":"d8b082f0-af4d-4067-a289-d77dd57f1849","resolution":{"observed_at":"2026-05-11T12:46:24.805355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T04:31:26.325118Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:9c6e37fa44f0688d04d6430d1040c1dfb72efbf1f27c764524f534aab752f7d9","observation_id":"519af2ee-a3a0-4291-83e1-c444c03131fb","resolution":{"observed_at":"2026-05-11T21:41:19.050035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:06cccbeb384df1e532c4cbd8e3bb8df4150f089762971189a3afc87c0380e2a7","observation_id":"921dab5b-a36c-4778-adfb-20bfbf7fbcb0","resolution":{"observed_at":"2026-05-20T23:43:51.195508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2605.05646","last_updated":"2026-05-07T03:53:54Z","snapshot_observed_at":"2026-08-03T14:49:05.703728Z","submitted_at":"2026-05-07T03:53:54Z","title":"MUSE: Resolving Manifold Misalignment in Visual Tokenization via Topological Orthogonality","version":1},"reference_index":146,"source":"arxiv_source","source_observed_at":"2026-05-08T15:04:41.518195Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2605.05646"},"observation_digest":"sha256:f447e5e977db9b470a11bcef0749f04b60cea97937e687b8d19768fb04d83024","observation_id":"ac2fb108-0f9b-431b-8e5c-909ddd734640","resolution":{"observed_at":"2026-05-11T18:36:07.974566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-10T23:01:33.349669Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:d7de5d1464117c95d5225931ec494f5c99e86c13590ba9bc6373a7bc92f27c55","observation_id":"333d691b-d2e0-4bd4-9cd5-d6ba23abcb42","resolution":{"observed_at":"2026-05-11T18:41:10.358702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2605.11400","last_updated":"2026-05-12T01:43:57Z","snapshot_observed_at":"2026-08-11T08:38:23.159686Z","submitted_at":"2026-05-12T01:43:57Z","title":"UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T01:29:23.774196Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2605.11400"},"observation_digest":"sha256:94d72999dd1559f0ecdd0eb25208345a84d6db387aac1835dd53338e4dbf1d3f","observation_id":"008a8304-022a-4fbb-9b37-34e5fbe1fa6f","resolution":{"observed_at":"2026-05-13T01:47:04.898621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2605.17766","last_updated":"2026-05-18T02:35:05Z","snapshot_observed_at":"2026-08-02T02:51:49.314780Z","submitted_at":"2026-05-18T02:35:05Z","title":"LatentUMM: Dual Latent Alignment for Unified Multimodal Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T12:39:28.058049Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2605.17766"},"observation_digest":"sha256:f7dcc413efdb33388069cfd1a742a8340b6922b76719da9e51a0d184b162a9e7","observation_id":"4473075d-f5ca-4df6-8206-6ce5471a2566","resolution":{"observed_at":"2026-05-20T12:43:17.389113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-20T11:32:24.007847Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:457938e383294165f5d7e302ab90dc9c9cac3adb425ca87877185889dc34403d","observation_id":"6a177bd3-2801-445e-91e8-250c9704f213","resolution":{"observed_at":"2026-05-20T11:33:14.301808Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:222627af170defaefdaaa2fc8799f39bf32a08f761470aa22f29d572021be164","observation_id":"a318c7ae-ef0e-480b-9093-0fd3fadac828","resolution":{"observed_at":"2026-06-30T18:35:00.345303Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:4c5edb167f1ecdac4f6e8aae62e8dbd537567e133f33a46def759645b9bf243b","observation_id":"56505dc3-693d-40eb-bc29-692615926173","resolution":{"observed_at":"2026-07-03T14:38:28.896947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2606.23041","last_updated":"2026-07-02T11:57:59Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T08:48:19Z","title":"SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-26T09:08:25.661515Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2606.23041"},"observation_digest":"sha256:c14df1a08998e0a3f1abc4550ed52a43066ce39f8cc4c26bd9d7dea1b3ad3d5b","observation_id":"8243c92a-4a9d-47b3-a384-fee137bb55cc","resolution":{"observed_at":"2026-07-04T10:09:44.697635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2606.23041","last_updated":"2026-07-02T11:57:59Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T08:48:19Z","title":"SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-03T23:15:09.253879Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2606.23041"},"observation_digest":"sha256:522ddb427ea0f7918afdcd5cd1dd6f5752b545a7c9802aeb92abd999d30e0c34","observation_id":"2e827ec3-e9be-4230-b11a-982702ef9b13","resolution":{"observed_at":"2026-07-03T23:19:02.439470Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2606.24849","last_updated":"2026-06-23T17:28:00Z","snapshot_observed_at":"2026-08-03T11:30:36.402988Z","submitted_at":"2026-06-23T17:28:00Z","title":"IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-26T00:19:49.071495Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2606.24849"},"observation_digest":"sha256:2e9c68264b8747cce59bf5b39ad5ff427356200648300b84c1ed091884bdd9c2","observation_id":"962dcbc7-89cc-4983-8fef-605c13eafe22","resolution":{"observed_at":"2026-07-04T16:39:58.238735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-13T05:11:19.001184Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09133","last_updated":"2026-07-27T13:55:46Z","snapshot_observed_at":"2026-08-06T19:20:12.388945Z","submitted_at":"2026-07-10T06:43:43Z","title":"IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T05:11:19.001184Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2607.09133"},"observation_digest":"sha256:86e9c974f703ac6257e83a68e95b52f6cfcc09f3bb0a9749242112d5f2aad3f6","observation_id":"4335c52f-26bc-460c-b559-203232a2b955","resolution":{"observed_at":"2026-07-13T05:11:19.001184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-08-02T07:44:18.617071Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09133","last_updated":"2026-07-27T13:55:46Z","snapshot_observed_at":"2026-08-06T19:20:12.388945Z","submitted_at":"2026-07-10T06:43:43Z","title":"IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:18.617071Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2607.09133"},"observation_digest":"sha256:d6f5d95587092d4b205f896b2f3cae0ab4598429f6830259262c65db8bdab5bd","observation_id":"8ae6621d-7e99-4606-8967-b66ff2bf033f","resolution":{"observed_at":"2026-08-02T07:44:18.617071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-08-05T00:46:23.340701Z","title":"arXiv preprint arXiv:2505.23661 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00559","last_updated":"2026-08-01T09:42:45Z","snapshot_observed_at":"2026-08-08T15:42:31.128764Z","submitted_at":"2026-08-01T09:42:45Z","title":"Test-Time Curriculum for Open-Set AIGC Detection","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-05T00:46:23.340701Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2608.00559"},"observation_digest":"sha256:f86d5e65eedb171fe4bebbd0e9c86ce445bd67f5442cdfed497172897d73e757","observation_id":"5d74a6e2-0343-4150-a5f2-213031a8a0d0","resolution":{"observed_at":"2026-08-05T00:46:23.340701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23661/citation-record","integrity":"/paper/2505.23661/integrity","json":"/paper/2505.23661/citation-record.json","paper":"/paper/2505.23661"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:12.668718Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:12.668718Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:339e6cfd857cef001017156e6092e03cac4ff174b3969427073b7ac68108c99e","observation_id":"6035d8ec-a76e-4ea3-b87f-954d67ad2cc0","resolution":{"observed_at":"2026-08-07T12:44:12.668718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:12.783250Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:12.783250Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:36a98dd5b920302d6783226523db65b1da5743bb7c3526466b84fbda740ff359","observation_id":"d4a14748-5626-46a2-b2f0-d7828f34232f","resolution":{"observed_at":"2026-08-07T12:44:12.783250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:12.894781Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:12.894781Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:add7830cff3e5820c85285c52c59f04f731880951762b108cbc7fbc0ce84b7cc","observation_id":"578b26f6-e097-41ca-9f47-f8e52869ffde","resolution":{"observed_at":"2026-08-07T12:44:12.894781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T12:44:12.987323Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:12.987323Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:553efd4e854f297755d6975c24128cf062ee39d66382a450ea767ab564530ce8","observation_id":"7054ed70-b2e0-4bd7-8a9a-eef25feca87a","resolution":{"observed_at":"2026-08-07T12:44:12.987323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:13.043657Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:13.043657Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:4649c3f13bdebc9581de104427c599cffa61cfb0b4eb18d611c616afa0962d62","observation_id":"0d1ff2ac-df0c-4395-b94e-d6748d81253f","resolution":{"observed_at":"2026-08-07T12:44:13.043657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T12:44:13.101067Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:13.101067Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:d5e26e8e60c72a99b21754cad17cbe5806da260823e5cdb0f2457b7bb198c980","observation_id":"3bf26c07-2194-4332-bacf-f1af516967b0","resolution":{"observed_at":"2026-08-07T12:44:13.101067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:13.184621Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:13.184621Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:c14d2cf47ff403415ee859409027670b24af0bf4bb944c3aab2c79ab60777a4d","observation_id":"fd256ac3-fec7-4db9-a8f9-e796a66a9bb7","resolution":{"observed_at":"2026-08-07T12:44:13.184621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T12:44:13.275342Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.arXiv preprint arXiv:2404.16821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:13.275342Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:6bbc074a044d3031c48ac6939fab2dd2f8399b2a5100f41bf1978d1b353db6f6","observation_id":"48873b2e-ed5e-451d-ab14-b7be49289677","resolution":{"observed_at":"2026-08-07T12:44:13.275342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:13.368913Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:13.368913Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:60060a4cd560c362adebb6483458f97e737e13bbaf19271768c025fa0dbd4d67","observation_id":"a7932a8d-5df6-4975-9d6e-a08bf667421e","resolution":{"observed_at":"2026-08-07T12:44:13.368913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:13.561728Z","title":"SDXL: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:13.561728Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:3355f361112ef3a53ee2c6d0706866d08eecf20f82fb1ba7e7a5ffe7b6e89a81","observation_id":"3f3ea260-958c-40a7-ba07-2f6de7deef77","resolution":{"observed_at":"2026-08-07T12:44:13.561728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-08-11T01:07:36.814668Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-07T12:44:13.780066Z","title":"PixArt-Sigma: Weak-to-strong training of diffusion transformer for 4K text-to-image generation.arXiv preprint arXiv:2403.04692, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:13.780066Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:d751761e8818801012ea262bc6be9ed8384d6613ce9f2b8c65e8c1fa7bb1c3a4","observation_id":"cc33ce15-5a5a-40cb-91cd-f8ffe9b554a6","resolution":{"observed_at":"2026-08-07T12:44:13.780066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:13.915135Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:13.915135Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:3c382636233d4497a6f1fdff8ce2e394d1a13c08c59d1eeae3f668c2ea50985f","observation_id":"9ee0b66b-1621-422d-baf0-e6c2443cb82b","resolution":{"observed_at":"2026-08-07T12:44:13.915135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T12:44:14.029102Z","title":"Hierarchical text-conditional image generation with clip latents.arXiv preprint arXiv:2204.06125, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.029102Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:2b1aaa852b8ec35cb4423c0de7c229ab0b7736be381ced8c4a3ca01ee005908a","observation_id":"4ea54124-5ae1-4e4f-a7df-a3851213fbfe","resolution":{"observed_at":"2026-08-07T12:44:14.029102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:14.132584Z","title":"Improving image generation with better captions.Computer Science","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.132584Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:d94e8934a2ab94c9224f692ce34a1f475ab399b2b5cfbc30bc43708bff6b0f2e","observation_id":"8f5966fa-82c8-4c95-b511-30fee3c82857","resolution":{"observed_at":"2026-08-07T12:44:14.132584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:14.230577Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.230577Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:079dff5e9d120bcc53dd3badd8f4d6a6b5a5dfa604665c82b650a9f3c4ef7d5d","observation_id":"2ed071f9-acf5-477a-852a-ccd165990bc6","resolution":{"observed_at":"2026-08-07T12:44:14.230577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T12:44:14.337586Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.337586Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:7b21df59f64ccb80672890447e9977668c560cb037724cd9a9c30492f0be3ad3","observation_id":"c87388e8-1a6a-44c0-a5e4-6a5d94ef3bc6","resolution":{"observed_at":"2026-08-07T12:44:14.337586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-09T20:05:31.409634Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T12:44:14.494263Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.494263Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:ec61c26137cb9fc93130aa4c4a973dcc700ff3503bdb3d6acee14b5e9cad024f","observation_id":"34ab3c70-925c-4147-91a7-c49f487e21fa","resolution":{"observed_at":"2026-08-07T12:44:14.494263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-07T12:44:14.606841Z","title":"Vila-u: a unified foundation model integrating visual understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.606841Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:b61dcb9337ff9a05001c304de8607b1bd6e94731e90f036f6cbfd91dc1105f80","observation_id":"fc3aa865-95bc-4299-a5b2-ae5b1f852c80","resolution":{"observed_at":"2026-08-07T12:44:14.606841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T12:44:14.742428Z","title":"Show-o: One single transformer to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.742428Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:bedeff468504640a576b3c698fc61dd49ae8f40a5de57368c46e775bad391f31","observation_id":"a4ff7499-3701-4273-bee7-aaf6c91ab774","resolution":{"observed_at":"2026-08-07T12:44:14.742428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-07T12:44:14.810243Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation.arXiv preprint arXiv:2410.13848, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.810243Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:cbb645bc7ccd7d889105856cf216328a31c2e4e8673b22fd4d48d6d07b560998","observation_id":"feee7fbc-8865-4c9e-a27c-61780c8fae68","resolution":{"observed_at":"2026-08-07T12:44:14.810243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:14.891013Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.891013Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:c11ca0170a0865566b57e52964beac5b430ba0767170553c92ef85ade0049817","observation_id":"e20cbcff-517f-4cda-a019-6c68bd4f3b08","resolution":{"observed_at":"2026-08-07T12:44:14.891013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","snapshot_observed_at":"2026-08-11T20:41:55.840334Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09604","snapshot_observed_at":"2026-08-07T12:44:14.957297Z","title":"Synergen-vl: Towards synergistic image understanding and generation with vision experts and token folding.arXiv preprint arXiv:2412.09604, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.957297Z"},"links":{"cited_paper":"/paper/2412.09604","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:40f77ce3747d0ae8cb4d0ac82dd1d18dd3d643191bec1c5cff25ba2d3725b7cb","observation_id":"e06dda0f-75f6-4bd1-8c8d-770a35ed0620","resolution":{"observed_at":"2026-08-07T12:44:14.957297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-11T10:16:40.394612Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-07T12:44:15.039181Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.039181Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:409d50f6fc709dfbf745a15a0e9ee775bd407d312e44a1be1770599d9acb26bf","observation_id":"c7590a71-3091-42fb-ac32-7b3bb6302515","resolution":{"observed_at":"2026-08-07T12:44:15.039181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:15.110694Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.110694Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:27bd979399a5022f176d9e19d3184bef8be6ba60c042289e21a062e965c6cb0f","observation_id":"e9dea184-515f-4a16-8c6f-2a99ab13ca1e","resolution":{"observed_at":"2026-08-07T12:44:15.110694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06673","last_updated":"2024-12-09T17:11:50Z","snapshot_observed_at":"2026-08-11T19:23:16.518889Z","submitted_at":"2024-12-09T17:11:50Z","title":"ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06673","snapshot_observed_at":"2026-08-07T12:44:15.148096Z","title":"Illume: Illuminating your llms to see, draw, and self-enhance.arXiv preprint arXiv:2412.06673, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.148096Z"},"links":{"cited_paper":"/paper/2412.06673","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:80ea9938aa9b18db44dece32fb351dba0539f843e8c79093163d4dc01725e794","observation_id":"5c9ce947-b55b-4545-be2e-997b370492f3","resolution":{"observed_at":"2026-08-07T12:44:15.148096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-08T15:05:21.947334Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-07T12:44:15.179360Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning.arXiv preprint arXiv:2412.14164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.179360Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:0af80697c68dc54dde1a58da1090d84f977af7595c3a091c5bbaa0280e1321bd","observation_id":"189049c2-f882-4d64-b9bb-2f825baa2e5f","resolution":{"observed_at":"2026-08-07T12:44:15.179360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:15.204122Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.204122Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:189d1e301fda29c5ab9315b491273a1e90964826e9c90d8d47c7c25a4622c3be","observation_id":"10b76f1f-2460-40a6-a315-cdc7ee7d006d","resolution":{"observed_at":"2026-08-07T12:44:15.204122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21979","last_updated":"2025-04-22T04:26:58Z","snapshot_observed_at":"2026-08-07T16:31:36.925232Z","submitted_at":"2025-03-27T20:50:38Z","title":"Harmonizing Visual Representations for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21979","snapshot_observed_at":"2026-08-07T12:44:15.245982Z","title":"Harmonizing visual representations for unified multimodal understanding and generation.arXiv preprint arXiv:2503.21979, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.245982Z"},"links":{"cited_paper":"/paper/2503.21979","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:6349e814a5589a2af026f05fc93ee80aa9a4c2ccabcfa7efaf964f0acfbbf748","observation_id":"a5e5cb3f-18c4-41c5-ac11-7305a4af5284","resolution":{"observed_at":"2026-08-07T12:44:15.245982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:20.589453Z","title":"Transfer between modalities with metaqueries, 2025","venue":null,"work_id":"97af53df-b305-4cd2-97ab-49f473b13922","year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.331127Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:965fe7b4202bb04595e113280c55364c06a74a860481c281286165047e092598","observation_id":"7fcac129-639a-4db5-b51a-66727b97a7e1","resolution":{"observed_at":"2026-08-07T12:44:20.671731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:15.407565Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.407565Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:049d82a7e6c0d7ccee2042f21977f34cdf3d24596f270c12b91cdcd48c380f12","observation_id":"1c947697-6a78-4fde-b22c-7779b8e343b1","resolution":{"observed_at":"2026-08-07T12:44:15.407565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:15.481465Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.481465Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:2f0d9ffba13b3525381c6bd85af4122bee82d6bfd5f8edef0671a1f019228189","observation_id":"41ef8a11-9e40-44c8-b07d-8ea86291d395","resolution":{"observed_at":"2026-08-07T12:44:15.481465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:15.558349Z","title":"Sigmoid loss for language image pre- training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.558349Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:5d81870a14b5405df74a867f5b4ba61d2c0e483978cfe943f6c7a472cf966b4a","observation_id":"d49b3c90-0a92-413f-a3f3-805b76b068b4","resolution":{"observed_at":"2026-08-07T12:44:15.558349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:44:15.611853Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.611853Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:e3795fd0ecf9484397eb6f3ebf241f804f11e2908662239aa2b51b6f5f58e652","observation_id":"eaefd3ea-0f7b-4612-aeaa-352193c3059c","resolution":{"observed_at":"2026-08-07T12:44:15.611853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:44:15.658112Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.658112Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:7f2a5cc2aa698d9ed207c3af01aee5251bc35e1cfd76339e1de57403e02946c3","observation_id":"5573576b-e62c-4c13-8f53-a4148241707c","resolution":{"observed_at":"2026-08-07T12:44:15.658112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:20.444847Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models, 2025","venue":null,"work_id":"5b774e55-b865-47d5-9e9b-854810ccb1b3","year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.707332Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:f98d995d0683ee3879e1c5414ce1c17d93790f11d3b50e20f5ec0b818253228a","observation_id":"76af517e-7ec2-40fd-977e-99a915ce80c3","resolution":{"observed_at":"2026-08-07T12:44:20.495287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T12:44:15.737384Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.737384Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:87c67bab48cf76a477ce003183e2edb82898bcd6e3b3117e6f036412059f54b6","observation_id":"92061989-3c66-4e66-9699-a0e2baa14917","resolution":{"observed_at":"2026-08-07T12:44:15.737384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-07T12:44:15.790154Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models.arXiv preprint arXiv:2403.18814, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.790154Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:5023ffe216314bd46f92e48bf76935576fcccc8b9dd62475c3f0b98312f2d2db","observation_id":"50d89353-e2df-46d1-9085-6e6aed608311","resolution":{"observed_at":"2026-08-07T12:44:15.790154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-07T12:44:15.884310Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding.arXiv preprint arXiv:2412.10302, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.884310Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:ba8a4a732d8b83863811de56cbf2e4f77023809510501bd0ede0ad05edd0f6ca","observation_id":"39b5e017-0143-4b75-9849-cd0125d4f9fd","resolution":{"observed_at":"2026-08-07T12:44:15.884310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:15.937556Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.937556Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:7f1a71b50d09ca86a9c591f0a6f4aac6607131dbd258a2e0a6bd58d21b8cb793","observation_id":"07610958-a4b0-4e79-be63-b8bf11b1e917","resolution":{"observed_at":"2026-08-07T12:44:15.937556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T12:44:16.037523Z","title":"Hunyuan-DiT: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.037523Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:d9d7c3a2183e270f9363ce986f4482823230920b469c61fc41c601f26cbd3611","observation_id":"2077f18a-effd-48eb-be04-092b0ee7208c","resolution":{"observed_at":"2026-08-07T12:44:16.037523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:16.103086Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.103086Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:8d55c0ba554077c08e287a35a99a1147b2e4e556cfd45dd24aa97443fde197f7","observation_id":"ec1f466d-522f-403c-9f96-6012750e4d9b","resolution":{"observed_at":"2026-08-07T12:44:16.103086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:16.284865Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.284865Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:1d27cf35f5e2994970a61abad19458158f802c71e8c5caaf3494036017393e8c","observation_id":"9ab9c62b-e79b-4b6b-97f6-a13c8b0f88f7","resolution":{"observed_at":"2026-08-07T12:44:16.284865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:16.361544Z","title":"Scaling rectified flow transformers for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.361544Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:45fd2b0970b9a220411955da43f78644f2ee39fea06a331ab79efce9f481da5b","observation_id":"c60d4210-7d90-44e4-b06c-ea52c35bfb5e","resolution":{"observed_at":"2026-08-07T12:44:16.361544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:20.209573Z","title":"Sana: Efficient high-resolution image synthesis with linear diffusion transformers, 2024","venue":null,"work_id":"4882fd59-4236-4c1b-9a49-1e00234f3413","year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.438696Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:f92ded5decd577660595ac045b9b9097409ad0542c6a7dc0c341bcf44b488505","observation_id":"5ea1f9f1-6990-4fd9-b2fa-c90bcf99f027","resolution":{"observed_at":"2026-08-07T12:44:20.273660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:16.556293Z","title":"Flux.https://github.com/black-forest-labs/flux, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.556293Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:436cdc2c42668ad6bbaef1b67d89749e15f0379207775399c0125fdfc855464c","observation_id":"4dfaf339-61e1-49d1-8b58-eda1097cfc44","resolution":{"observed_at":"2026-08-07T12:44:16.556293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:20.123493Z","title":"Sit: Exploring flow and diffusion-based generative models wfith scalable interpolant transformers","venue":null,"work_id":"fd26035b-1f4c-4aa5-af41-1f921e72f87d","year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.644623Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:5699318c7960d3ebd52aec5d1b1828aeb4542b6117bab1275ba52072dc61868c","observation_id":"19350a6c-032d-4ce6-8ec1-3fb0e20ebb8e","resolution":{"observed_at":"2026-08-07T12:44:20.150952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18583","last_updated":"2024-06-05T17:53:26Z","snapshot_observed_at":"2026-08-06T11:25:48.819238Z","submitted_at":"2024-06-05T17:53:26Z","title":"Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18583","snapshot_observed_at":"2026-08-07T12:44:16.743577Z","title":"Lumina-next: Making lumina-t2x stronger and faster with next-dit.arXiv preprint arXiv:2406.18583, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.743577Z"},"links":{"cited_paper":"/paper/2406.18583","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:3689d965046ab20c5ad2b699f456d2920448157e98e9bc6d5f7614e8452918e1","observation_id":"f46da92d-f9b5-4608-99af-db1e4c6520d2","resolution":{"observed_at":"2026-08-07T12:44:16.743577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18427","last_updated":"2025-05-17T13:26:31Z","snapshot_observed_at":"2026-08-09T23:29:58.320860Z","submitted_at":"2025-01-30T15:31:48Z","title":"SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18427","snapshot_observed_at":"2026-08-07T12:44:16.826082Z","title":"Sana 1.5: Efficient scaling of training-time and inference-time compute in linear diffusion transformer.arXiv preprint arXiv:2501.18427, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.826082Z"},"links":{"cited_paper":"/paper/2501.18427","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:aa045c70e27ef081a8995f24e9952133bd9cdd5ad3bfb84bf3117e53773fcff1","observation_id":"76282589-2e37-47ca-b250-694a41e03f99","resolution":{"observed_at":"2026-08-07T12:44:16.826082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10733","last_updated":"2025-05-18T21:17:22Z","snapshot_observed_at":"2026-08-08T21:24:29.917572Z","submitted_at":"2024-10-14T17:15:07Z","title":"Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10733","snapshot_observed_at":"2026-08-07T12:44:16.907537Z","title":"Deep compression autoencoder for efficient high-resolution diffusion models.arXiv preprint arXiv:2410.10733, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.907537Z"},"links":{"cited_paper":"/paper/2410.10733","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:1abc69c1d1121299294d604ace4abbffa70501d3fd81c44c740ef5c65cde9a05","observation_id":"38a85164-1543-46b7-b883-2d733592397b","resolution":{"observed_at":"2026-08-07T12:44:16.907537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.012891Z","title":"Efficientvit: Lightweight multi-scale attention for high-resolution dense prediction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.012891Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:7516d1dceafbc3648fb83e5e57aed8dc4a215b4ed91d648c1654bd16ca934e29","observation_id":"c8d77a9a-3258-4780-8bc4-d4aadae3a339","resolution":{"observed_at":"2026-08-07T12:44:17.012891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05821","last_updated":"2025-04-11T14:21:24Z","snapshot_observed_at":"2026-08-10T18:44:02.484060Z","submitted_at":"2024-06-09T15:14:26Z","title":"F-LMM: Grounding Frozen Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05821","snapshot_observed_at":"2026-08-07T12:44:17.054823Z","title":"F-lmm: Grounding frozen large multimodal models.arXiv preprint arXiv:2406.05821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.054823Z"},"links":{"cited_paper":"/paper/2406.05821","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:a85d23e89aac4bf3b9d25bd04755c400b391808f1bcce013be252e8bd44112c8","observation_id":"e6378ad2-21fc-4c2c-939a-1eaa4ae8a8dd","resolution":{"observed_at":"2026-08-07T12:44:17.054823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-11T11:31:09.745295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-07T12:44:17.119373Z","title":"Llamafusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.119373Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:c366488bb29486c04a71d4eb453a07a8dde492ad3023d056e52d61a8c94e739e","observation_id":"4e7650c6-7a75-4f80-a7ee-22d476024b72","resolution":{"observed_at":"2026-08-07T12:44:17.119373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07951","last_updated":"2025-08-09T17:12:35Z","snapshot_observed_at":"2026-08-07T16:06:45.054589Z","submitted_at":"2025-04-10T17:57:28Z","title":"Scaling Laws for Native Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07951","snapshot_observed_at":"2026-08-07T12:44:17.154880Z","title":"Scaling laws for native multimodal models.arXiv preprint arXiv:2504.07951, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.154880Z"},"links":{"cited_paper":"/paper/2504.07951","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:6ff94bdcf921d538acf0ca74bbf1b7ca60461191da175274dadf31b8da52290c","observation_id":"3e059d4e-8c73-46df-a29c-1c8a4bb510f2","resolution":{"observed_at":"2026-08-07T12:44:17.154880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:44:17.248177Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.248177Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:423e8a34e7ed0a408e4264c2932542390d918b995799d19d83edbc6c9bddfee0","observation_id":"13c031c1-c6c1-43ea-8e5c-f94f3a17d559","resolution":{"observed_at":"2026-08-07T12:44:17.248177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T12:44:17.315211Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.315211Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:36da19b21b5692d5ec3950df89f9a87645709dd58eb1d20246edf38b3bec35e3","observation_id":"f667d273-2f2e-47ac-892a-b5ff3481590c","resolution":{"observed_at":"2026-08-07T12:44:17.315211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T12:44:17.387643Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.387643Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:3c7ec62e334929e2e14eb8ddae2d2e2b92f4f3df360b3b1f52355b27b2647881","observation_id":"20ea9665-0bbe-4b92-b2dc-81d09ba090cf","resolution":{"observed_at":"2026-08-07T12:44:17.387643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T12:44:17.429682Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.429682Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:045a6e5e97a477dd91c5828282b2af2949607440f2d11b14cd2cfa744afd5b24","observation_id":"bef601de-0ec9-4569-b8aa-0709d22d821b","resolution":{"observed_at":"2026-08-07T12:44:17.429682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.506293Z","title":"High-resolution image synthesis with latent diffusion models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.506293Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:e8121680826ccb94f53863ca9f32f52c3553293fd639040f395cd50ef2b7a7c9","observation_id":"d648e502-14c5-431f-815f-920dd602f54d","resolution":{"observed_at":"2026-08-07T12:44:17.506293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-07T12:44:17.567850Z","title":"Pixart- alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.567850Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:89568dabaceef810e139558f8558269436878fa36af729c58742978e6674e56a","observation_id":"0762f47d-604d-422f-92ef-14c98bdbfb6a","resolution":{"observed_at":"2026-08-07T12:44:17.567850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T12:44:17.634220Z","title":"Emu3: Next-token prediction is all you need.arXiv preprint arXiv:2409.18869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.634220Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:1d16f7014c0704016cfeeda8cc97ee86f4a3bd69e66ac6bd7e3d31030294f08e","observation_id":"e6d7ba6e-4e7f-484b-8866-57a44e081f07","resolution":{"observed_at":"2026-08-07T12:44:17.634220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.685541Z","title":"Flow-grpo: Training flow matching models via online rl, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.685541Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:4d11824d77e9cb9769bd553ce4db57fc4fd3cc1a87ce23184977acd5c02aa7c6","observation_id":"b128eb78-e9c5-4581-a077-ba2022a1ad64","resolution":{"observed_at":"2026-08-07T12:44:17.685541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-07T12:44:17.764755Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation.arXiv preprint arXiv:2404.14396, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.764755Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:01f61465e6e0618033f7a813a7b534d41d3ff0731e39b31dba2384c850263456","observation_id":"cdcc7b72-102b-4a33-a9df-31ce5984a324","resolution":{"observed_at":"2026-08-07T12:44:17.764755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-11T03:45:32.889856Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-07T12:44:17.824218Z","title":"World model on million-length video and language with ringattention.arXiv preprint arXiv:2402.08268, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.824218Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:72906c9d72da49c8a4a8e1aec7cd337ee94dbeec4cb3811784b6552bdd56d9d7","observation_id":"15e45610-e6f7-481a-aac5-478ccd9f27d4","resolution":{"observed_at":"2026-08-07T12:44:17.824218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11455","last_updated":"2025-04-15T17:59:46Z","snapshot_observed_at":"2026-08-08T11:00:06.035456Z","submitted_at":"2025-04-15T17:59:46Z","title":"SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11455","snapshot_observed_at":"2026-08-07T12:44:17.919986Z","title":"Simplear: Push- ing the frontier of autoregressive visual generation through pretraining, sft, and rl.arXiv preprint arXiv:2504.11455, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.919986Z"},"links":{"cited_paper":"/paper/2504.11455","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:c1159b9a427d220d2ef5b085cbd6d8794ffa32404d07145abafd84e717329e46","observation_id":"62f640ca-edc3-42c1-af76-465ed47dc62d","resolution":{"observed_at":"2026-08-07T12:44:17.919986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:19.993185Z","title":"text-to-image-2M: A high-quality, diverse text–image training dataset","venue":null,"work_id":"6557fc1f-1afa-4d41-9e32-4a64236b722d","year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.986317Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:253f23588690e88a359c9f5805b7d2b9920103ab75d6b8919418049276fc7f4c","observation_id":"010c2984-c358-4ce9-b2c1-2177b04ea6d5","resolution":{"observed_at":"2026-08-07T12:44:20.017543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:18.086468Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 35:25278–25294, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.086468Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:113f40882c3420d9ce59159efaa9048fbf9801d4ae97f38daf4dffc213edfa12","observation_id":"538e3db9-6637-4525-a4cb-c950e8931524","resolution":{"observed_at":"2026-08-07T12:44:18.086468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:19.873979Z","title":"Megalith-10M: A dataset of 10 million public-domain photographs","venue":null,"work_id":"6f3fc8b3-ae33-4385-bc64-5e216e29f047","year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.163452Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:7b24c40de25f017c8653c544b95561c30c447639de62198a6703e37a982e1270","observation_id":"cb5006ae-20b2-4e04-bedc-c6914bae2c8f","resolution":{"observed_at":"2026-08-07T12:44:19.908808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:19.777246Z","title":"RedCaps: Web-curated image–text data created by the people, for the people","venue":null,"work_id":"4b599983-a362-44c3-8b45-db71ac635e75","year":2021},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.256979Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:ba84dad634503bc8249a14efb9abf12aa694abd317b72f0bbe5d74439475aa63","observation_id":"c1e9cfc8-45c1-4728-bf5b-8f6682335c2e","resolution":{"observed_at":"2026-08-07T12:44:19.834909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-07T12:44:18.323666Z","title":"Playground v2.5: Three insights towards enhancing aesthetic quality in text-to-image generation.arXiv preprint arXiv:2402.17245, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.323666Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:c03172e4aa88b576e7a327ad46f95dd6b51e915c3de31cb79578121c4204bc6a","observation_id":"44765e00-e05b-477d-8811-bd652baf00a5","resolution":{"observed_at":"2026-08-07T12:44:18.323666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:18.427453Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.427453Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:a75da6add98852a94e95ea5db996e3cf73ed7484f5faf86e7c55391094fabaec","observation_id":"0c6db8f2-4aab-47be-90c5-330ac5c78f80","resolution":{"observed_at":"2026-08-07T12:44:18.427453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-09T16:24:26.560430Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-07T12:44:18.464184Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment.arXiv preprint arXiv:2403.05135, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.464184Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:5b49469d8f18208bf7b84dab3ac02648c233afe2c48080116de916fe9f6f18e2","observation_id":"eea42e66-daf8-4d68-9b58-bb75b8c65925","resolution":{"observed_at":"2026-08-07T12:44:18.464184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-08-07T12:44:18.542352Z","title":"Wise: A world knowledge-informed semantic evaluation for text-to-image generation.arXiv preprint arXiv:2503.07265, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.542352Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:00a7a4134ec6f79ee0c1f4e6629e8fd3593099ea4535e8be4dc5d71c6658ee63","observation_id":"47103e9b-bdb7-42c9-94ba-44a69aa07525","resolution":{"observed_at":"2026-08-07T12:44:18.542352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-08-11T22:45:59.824084Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-07T12:44:18.590800Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation.arXiv preprint arXiv:2412.03069, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.590800Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:e5462bee2be0e130de87b0860504282f09c24201c6db65af1017dae5c9661499","observation_id":"29dcb26a-57e5-44e0-8b57-e43c8271223a","resolution":{"observed_at":"2026-08-07T12:44:18.590800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 26 inbound Pith citation observations for arXiv:2505.23661."}