{"as_of":"2026-08-14T07:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cafa002e1ee641650af020305cf5f27be2d622ea3caeb024f895196e0a869065","coverage":[{"denominator":94,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":94,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:01:49.976800Z","state":"measured"},{"denominator":94,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":94,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.20214/citation-record","integrity":"/paper/2506.20214/integrity","json":"/paper/2506.20214/citation-record.json","paper":"/paper/2506.20214"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:01:49.550995Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.550995Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:7edf4e2029cbfd4717601bbd7011bd5000859838446c26760d702c9b8106256c","observation_id":"872bb111-9d23-41b6-9b8e-0ae57d180100","resolution":{"observed_at":"2026-08-06T23:01:49.550995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.556467Z","title":"Foundation models defining a new era in vision: a survey and outlook.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.556467Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:29dc261f4c22633fb2b986645819ce096095c61ebbfe9e942564f2f594a18f5d","observation_id":"c519187e-b57e-478a-bbb5-2104d25374b8","resolution":{"observed_at":"2026-08-06T23:01:49.556467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T23:01:49.561153Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.561153Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:496ff86a7829b461a8f55c284bbab17c927de1743e7aeb56eb13e33c4ee56166","observation_id":"ff2c862b-d8d5-4b29-89a1-d4071d76d42e","resolution":{"observed_at":"2026-08-06T23:01:49.561153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T23:01:49.566349Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.566349Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:ba6dde97489d66944bbbad001d0eb5c9a2c6f6034f82ad817a8fa3cc717c46d4","observation_id":"9e2bc2f0-20ff-4014-95f4-5d937639e659","resolution":{"observed_at":"2026-08-06T23:01:49.566349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16681","last_updated":"2024-11-27T17:04:36Z","snapshot_observed_at":"2026-08-13T06:26:49.936666Z","submitted_at":"2024-11-25T18:59:53Z","title":"Factorized Visual Tokenization and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16681","snapshot_observed_at":"2026-08-06T23:01:49.571001Z","title":"Factorized visual tokenization and generation.arXiv preprint arXiv:2411.16681, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.571001Z"},"links":{"cited_paper":"/paper/2411.16681","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:80d4b1cfc880fcca43adfb709aee575bca81e4dc44644a16fe5963ac8842d6de","observation_id":"c6c07830-669c-4a0c-a60d-4e6f2a51b4ff","resolution":{"observed_at":"2026-08-06T23:01:49.571001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-08-13T16:48:25.566954Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-06T23:01:49.575932Z","title":"Beit: Bert pre-training of image trans- formers.arXiv preprint arXiv:2106.08254, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.575932Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:23f3fda2bf3ce91c903e1d31b2e3c234534fa80f2b47450f3761fa8d545c628b","observation_id":"f8fb298e-2b8e-4ef4-b4a7-557b3cc17120","resolution":{"observed_at":"2026-08-06T23:01:49.575932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.581184Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.581184Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:da13ae3063bc366ce251a9bcb2365640210943b99fe102ba53e5ff2363237607","observation_id":"bd2f5d7a-2895-443e-b3ae-5a59da144700","resolution":{"observed_at":"2026-08-06T23:01:49.581184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.586310Z","title":"Efficient-vqgan: Towards high-resolution image generation with efficient vision transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.586310Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:e913bed3ed9c8116e541960b2e7d7f13541bc5ba917e0460e490e3f85e412906","observation_id":"1b4190ce-a9a4-46cb-a7da-e4fbc838671b","resolution":{"observed_at":"2026-08-06T23:01:49.586310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-06T23:01:49.590864Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.590864Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:f3582f799fd10c1918b6d32d9f28aa442f932219f9d23ab78e84780186f303e0","observation_id":"816e7878-d28f-448d-a0f6-60b9fb2112c2","resolution":{"observed_at":"2026-08-06T23:01:49.590864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.596284Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.596284Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:fc3e7f6bacb638ccaaad09846cb32c9d61a3fe070f5a825d8d767157aff1b159","observation_id":"9506d091-090d-4eb3-acaf-49d4a46c20cc","resolution":{"observed_at":"2026-08-06T23:01:49.596284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T23:01:49.600626Z","title":"Are we on the right way for evaluating large vision-language models?arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.600626Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:cd085b53cc06ec81eed2c8db387643f81436ac936f7c6f0920a332fb22c9d0f8","observation_id":"64a43b10-e34a-4164-b74c-3f6c65919106","resolution":{"observed_at":"2026-08-06T23:01:49.600626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.605012Z","title":"Mai: A multi-turn aggregation- iteration model for composed image retrieval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.605012Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:7297ef4965f6589b70b7ac05873b4900dcb89b15cfbe66fb10c27e2ad9be9dfb","observation_id":"58253b53-f465-41f8-972c-0209037c50fb","resolution":{"observed_at":"2026-08-06T23:01:49.605012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T23:01:49.609193Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.609193Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:a27a173bdbfe489ceaad1053742b6b8f9a4b618b293c2bb0a830890d717007ba","observation_id":"0e6275c0-886e-40ec-9c56-8ffdf8686cb0","resolution":{"observed_at":"2026-08-06T23:01:49.609193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.613792Z","title":"Semhitok: A unified image tokenizer via semantic-guided hierarchical codebook for multimodal understanding and generation.arXiv preprint arXiv:2503.06764, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.613792Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:d90b3a61b139615ca4f0aa469a050456e76a9788acc0746dcf85c9e91ccb16b4","observation_id":"a7fe78e5-91cf-4dcf-82af-54c450071935","resolution":{"observed_at":"2026-08-06T23:01:49.613792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06135","last_updated":"2024-07-08T17:08:02Z","snapshot_observed_at":"2026-08-12T23:26:33.347925Z","submitted_at":"2024-07-08T17:08:02Z","title":"ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06135","snapshot_observed_at":"2026-08-06T23:01:49.618223Z","title":"Anole: An open, autoregressive, native large multimodal models for interleaved image-text generation.arXiv preprint arXiv:2407.06135, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.618223Z"},"links":{"cited_paper":"/paper/2407.06135","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:e9c265b641ca743a6ab17e247ca3dea33bf3d940cd6ceba2fbffff89535be95c","observation_id":"5b1cc51a-8109-4340-8a18-1e8590487aa4","resolution":{"observed_at":"2026-08-06T23:01:49.618223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-13T10:09:02.594270Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-06T23:01:49.622707Z","title":"Dreamllm: Synergistic multimodal comprehension and creation.arXiv preprint arXiv:2309.11499, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.622707Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:6c1375f2aa9f8a1f540d5c015758d3bbb04d7a6ab0ab3fb737b3cf428c3455a4","observation_id":"df0a9eeb-3faf-47ed-84cb-1e5802130594","resolution":{"observed_at":"2026-08-06T23:01:49.622707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.627390Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.627390Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:fd53bd84b76625ec10b66703933440eb2c11b3deb474f0328434c182512625b5","observation_id":"8ed18f1b-c6ee-44bf-8092-f2139cc88e44","resolution":{"observed_at":"2026-08-06T23:01:49.627390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.631713Z","title":"Eva-02: A visual representation for neon genesis.Image and Vision Computing, 149:105171, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.631713Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:04a35b89e3968313d0f4557a7ac5537cb0a12d1e1beff6c0f3dbb86b3303afc1","observation_id":"ec0c0661-7393-4f8f-8e30-722e711d7eea","resolution":{"observed_at":"2026-08-06T23:01:49.631713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.636345Z","title":"Eva: Exploring the limits of masked visual representation learning at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.636345Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:4d86b933bff9f2cd8a88361a28eb36c7c0ecdf12657c08575aff25eeebf626a1","observation_id":"f3ff8017-8113-478e-a766-99933325d007","resolution":{"observed_at":"2026-08-06T23:01:49.636345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-06T23:01:49.640623Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation.arXiv preprint arXiv:2404.14396, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.640623Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:3e2001118e93721c5cda3c601968365571404dab18ea8e1f110e36b83eaa2328","observation_id":"a9370ca3-f9b0-4ecd-9790-ca3683e7cd07","resolution":{"observed_at":"2026-08-06T23:01:49.640623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.645064Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment.Advances in Neural Information Processing Systems, 36:52132–52152, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.645064Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:c26ba2d72d4acb31152b8ddaf98e956039e77739174190a241f738c8fdea82f9","observation_id":"d21b8d60-4825-4754-93c6-e0b072fb4956","resolution":{"observed_at":"2026-08-06T23:01:49.645064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.649556Z","title":"A survey on self-supervised learning: Algorithms, applications, and future trends.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.649556Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:20034b9a44a1d5d0e7c82890e66fb7d6c089142e6c58fe5acab3f4faa0392432","observation_id":"c5dfdd9f-140d-4262-92ef-2e1fb81f2bbf","resolution":{"observed_at":"2026-08-06T23:01:49.649556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-06T23:01:49.654183Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment.arXiv preprint arXiv:2403.05135, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.654183Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:c55cb0fb9dad34ca7e963ed360d92b764d6517087c424adb73ae6ae98641242b","observation_id":"07d11dca-9be3-4a51-9a81-ff3f8b66c356","resolution":{"observed_at":"2026-08-06T23:01:49.654183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01934","last_updated":"2025-04-03T16:43:14Z","snapshot_observed_at":"2026-08-07T16:13:53.338367Z","submitted_at":"2025-04-02T17:45:00Z","title":"ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01934","snapshot_observed_at":"2026-08-06T23:01:49.658476Z","title":"Illume+: Illuminating unified mllm with dual visual tokenization and diffusion refinement.arXiv preprint arXiv:2504.01934, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.658476Z"},"links":{"cited_paper":"/paper/2504.01934","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:fb99cc614e3068a668dd4b725649c3a67939c8a5c9d4fda0806e8a51a3f72646","observation_id":"4d2afe1e-87aa-4b55-9add-f11e96ef60c8","resolution":{"observed_at":"2026-08-06T23:01:49.658476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.662775Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.662775Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:d6142481d7f46f2ee31e4d78a635aed31e1384054687e48dc3dec169ab21617f","observation_id":"808afccd-3930-4e07-9246-7950dbbabb36","resolution":{"observed_at":"2026-08-06T23:01:49.662775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04423","last_updated":"2025-04-06T09:20:49Z","snapshot_observed_at":"2026-08-10T18:55:04.431072Z","submitted_at":"2025-04-06T09:20:49Z","title":"UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04423","snapshot_observed_at":"2026-08-06T23:01:49.667271Z","title":"Unitoken: Harmonizing multimodal understanding and generation through unified visual encoding.arXiv preprint arXiv:2504.04423, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.667271Z"},"links":{"cited_paper":"/paper/2504.04423","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:6e2017430ffaa3518ec7e59769e276fba50a4fc775a2dfe8ff4cf1e16c884b80","observation_id":"185a68ec-e17a-4264-a362-0c073d654f6d","resolution":{"observed_at":"2026-08-06T23:01:49.667271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.671702Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.671702Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:f7c9f69350be49551850de666f895cc84e2227c554e8dbc380b52738714c032c","observation_id":"5e474d8d-49d9-4e70-baca-5c8574236730","resolution":{"observed_at":"2026-08-06T23:01:49.671702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.676112Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.676112Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:a82b209d9e008f8c71d0db3eb3e9a5ef90f897edd464de8b07dc60ca47976eec","observation_id":"d1a0a8bb-4238-4767-ab93-68179d7ffadf","resolution":{"observed_at":"2026-08-06T23:01:49.676112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.680540Z","title":"Autoregressive image generation using residual quantization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.680540Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:9a7208ef442d9b43e0b1635c6e8dad25a068a5f6a0f5366a9fa4153440df63f9","observation_id":"e2dad82a-0490-4401-a0fa-dd809acb4476","resolution":{"observed_at":"2026-08-06T23:01:49.680540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T23:01:49.684769Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.684769Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:43caef367395feb2c74fe2128ff52ae182625b59c50f4a9b3525d5703df8388d","observation_id":"9a5a63a1-7d84-4fa7-9c57-fe42d513137f","resolution":{"observed_at":"2026-08-06T23:01:49.684769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-06T23:01:49.688963Z","title":"Seed- bench: Benchmarking multimodal llms with generative comprehension.arXiv preprint arXiv:2307.16125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.688963Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:d7fa9fdc9a8e31da787942c7ed272553012a7034ae5fdd9e3544c3ef36088c17","observation_id":"e6328eb0-7a09-4e34-b5f5-ade67c75f138","resolution":{"observed_at":"2026-08-06T23:01:49.688963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.843982Z","title":"A survey of multimodel large language models","venue":null,"work_id":"ae99abd8-e3e4-4fdb-94d2-864ddd4f5d47","year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.693312Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:2a6adccf1205b8d69ed710900c70c2c32d797fb2b854e1cd682267d8b9e689f6","observation_id":"dfb0530e-9d56-4664-9f36-9be5475d79c5","resolution":{"observed_at":"2026-08-06T23:01:51.849440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.819609Z","title":"Toklip: Marry visual tokens to clip for multimodal comprehension and generation, 2025","venue":null,"work_id":"c4cde09a-c395-4548-90e1-9b5395837350","year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.697319Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:b1e6315df1ea53d38aeaa9074535cd43ed2f1c27119e8042c8dd34eecc6ca09c","observation_id":"2208cd6b-3b7a-431b-924a-1ad2e4eedd7d","resolution":{"observed_at":"2026-08-06T23:01:51.831628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-11T03:45:32.889856Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-06T23:01:49.702024Z","title":"World model on million-length video and language with blockwise ringattention.arXiv preprint arXiv:2402.08268, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.702024Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:6ac9d2bfce8c06604d802fb8a6ff92d887ee98130854f0b877551670eb62294f","observation_id":"cb6bdd6f-6d7e-4939-8f90-cacfc8886da7","resolution":{"observed_at":"2026-08-06T23:01:49.702024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.706281Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.706281Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:41bbdc9f28456fd6c0824c1a8e3af6904256b42e81244f13d2bee6a79ee1f27b","observation_id":"69d9c7a3-63e9-4f07-b34c-8b154f8d7278","resolution":{"observed_at":"2026-08-06T23:01:49.706281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.710584Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.710584Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:297ea1b8b70d44868b7f690148560a6c13de2a1c99d739f68073db190bd2e3f9","observation_id":"801b98e7-a0c7-4180-875f-475dbc187d5f","resolution":{"observed_at":"2026-08-06T23:01:49.710584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.715276Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.715276Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:de538f0b086897c89712e60d08f9044dbbed940d637b9b5ce3ad6205141c580d","observation_id":"b7310155-5a00-4fd4-bf02-b6a5ee3a3858","resolution":{"observed_at":"2026-08-06T23:01:49.715276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T23:01:49.719739Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.719739Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:3df8185e8776b8ca320dc742211986dd332a717ace719ccb276d5f8b60576074","observation_id":"c07dfd61-d9a0-43b6-aea3-adad6cb73cf1","resolution":{"observed_at":"2026-08-06T23:01:49.719739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-12T23:53:21.822871Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-06T23:01:49.723984Z","title":"Ovis: Structural embedding alignment for multimodal large language model.arXiv preprint arXiv:2405.20797, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.723984Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:1a93a07ad3635da739f1268d866be59dcf15ce6c80c81505f49c3fab726eb978","observation_id":"b9e15661-e791-481c-8847-73d935275cfd","resolution":{"observed_at":"2026-08-06T23:01:49.723984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.728398Z","title":"Unitok: A unified tokenizer for visual generation and understanding.arXiv preprint arXiv:2502.20321, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.728398Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:f2a7cf825570f09b93440f5057ce456a3f8dbc761859c19d76e5f1edfb5a1cbe","observation_id":"0297c9ca-c531-4fde-bd37-81888fd2e27f","resolution":{"observed_at":"2026-08-06T23:01:49.728398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07975","last_updated":"2025-03-24T08:33:32Z","snapshot_observed_at":"2026-08-13T22:53:32.402559Z","submitted_at":"2024-11-12T17:55:10Z","title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07975","snapshot_observed_at":"2026-08-06T23:01:49.732504Z","title":"Janusflow: Harmonizing autoregres- sion and rectified flow for unified multimodal understanding and generation.arXiv preprint arXiv:2411.07975, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.732504Z"},"links":{"cited_paper":"/paper/2411.07975","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:181987ca364d9834fd7fd83cd7eb2f8fcc8ff95217a98f939a9874d8802cd93f","observation_id":"b82b6d9c-43e2-4f05-9534-8aad015c5f2a","resolution":{"observed_at":"2026-08-06T23:01:49.732504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06366","last_updated":"2022-10-03T11:47:10Z","snapshot_observed_at":"2026-08-13T14:45:57.387723Z","submitted_at":"2022-08-12T16:48:10Z","title":"BEiT v2: Masked Image Modeling with Vector-Quantized Visual Tokenizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06366","snapshot_observed_at":"2026-08-06T23:01:49.737348Z","title":"Beit v2: Masked image modeling with vector-quantized visual tokenizers.arXiv preprint arXiv:2208.06366, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.737348Z"},"links":{"cited_paper":"/paper/2208.06366","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:d34f207c42b7d6ed2f331908191f3ba48c886dda417deb91679f1d0c6a950666","observation_id":"9393d3d7-75c3-4e01-895d-a6536e095847","resolution":{"observed_at":"2026-08-06T23:01:49.737348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T23:01:49.742089Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.742089Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:83a32a4b076fd4335d91923f18d9788641fc1a5e08cc1035c00f44249b069284","observation_id":"0f870014-1798-4722-a736-f277b0887bea","resolution":{"observed_at":"2026-08-06T23:01:49.742089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-08-14T01:35:56.896431Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-06T23:01:49.746510Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation.arXiv preprint arXiv:2412.03069, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.746510Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:f5dbff70843a749b5c8a34416ad6ccccbb15f95aeec90ac4b01c695cb5a25ebd","observation_id":"ce07186b-2fa2-4449-9253-24ff0f49ae5d","resolution":{"observed_at":"2026-08-06T23:01:49.746510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20388","last_updated":"2025-03-20T18:15:30Z","snapshot_observed_at":"2026-08-09T06:15:55.650722Z","submitted_at":"2025-02-27T18:59:08Z","title":"Beyond Next-Token: Next-X Prediction for Autoregressive Visual Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20388","snapshot_observed_at":"2026-08-06T23:01:49.751169Z","title":"Be- yond next-token: Next-x prediction for autoregressive visual generation.arXiv preprint arXiv:2502.20388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.751169Z"},"links":{"cited_paper":"/paper/2502.20388","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:c84f219abe1505dfc63d6bac75198571d6d4e2460c8950fe447adb833eea65bf","observation_id":"25f9e83f-3624-4516-9e8a-ef6009465aa1","resolution":{"observed_at":"2026-08-06T23:01:49.751169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.755625Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.755625Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:10d15e1d7825068b2f42cc04176a2321be498c23c694e133446ca30752e29e81","observation_id":"bcf6da21-bf3c-4997-9986-9c8c1ee82db2","resolution":{"observed_at":"2026-08-06T23:01:49.755625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02692","last_updated":"2025-03-10T09:01:48Z","snapshot_observed_at":"2026-08-12T11:16:32.406442Z","submitted_at":"2024-12-03T18:59:10Z","title":"Scalable Image Tokenization with Index Backpropagation Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02692","snapshot_observed_at":"2026-08-06T23:01:49.760298Z","title":"Taming scalable visual tokenizer for autoregressive image generation.arXiv preprint arXiv:2412.02692, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.760298Z"},"links":{"cited_paper":"/paper/2412.02692","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:2a9cdc7d19947fec769a1acd713b74e19e391794af9540f79578994379c65e3c","observation_id":"c99e1186-de25-478d-9674-808f355f0b44","resolution":{"observed_at":"2026-08-06T23:01:49.760298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.765263Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.765263Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:5c996d18bd5d58aa42648fdc9b568bb3c8af7a76917e28c6bc75793e3e18cd1c","observation_id":"741dca58-6de6-4114-b0c6-f8429c8d91b6","resolution":{"observed_at":"2026-08-06T23:01:49.765263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14324","last_updated":"2026-04-20T17:55:12Z","snapshot_observed_at":"2026-08-02T12:34:37.994590Z","submitted_at":"2025-03-18T14:56:46Z","title":"DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14324","snapshot_observed_at":"2026-08-06T23:01:49.769637Z","title":"Dualtoken: Towards unifying visual understanding and generation with dual visual vocabularies.arXiv preprint arXiv:2503.14324, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.769637Z"},"links":{"cited_paper":"/paper/2503.14324","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:17a8c49d237c22c66b95ab51f4c9437fe9eab652ce7eb4763b76f2d83f6d0b53","observation_id":"c0101e35-3818-4596-b9e2-af2b176910a6","resolution":{"observed_at":"2026-08-06T23:01:49.769637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.774524Z","title":"Journeydb: A benchmark for generative image understanding.Advances in neural information processing systems, 36:49659–49678, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.774524Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:00154ef742151b2014d39eb3f27a509d0475641622f75c8440824c55d1bb6207","observation_id":"9bea6b54-9227-4f47-b7d0-d89077778d14","resolution":{"observed_at":"2026-08-06T23:01:49.774524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-06T23:01:49.779091Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.779091Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:486c5d2e4b3da27c1a2a3ee6f04ab3f97c7d1228ce0b0fade74b73baba162ec4","observation_id":"9f449a2c-e8a0-495d-93cf-5922ea91ff05","resolution":{"observed_at":"2026-08-06T23:01:49.779091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.784005Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.784005Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:e05c035b624cb78c4b97cdafe7bcb4f3af93bb342fb839999468e1095e5ddade","observation_id":"6425bd17-4f4f-4304-9a6a-3c9b8059245d","resolution":{"observed_at":"2026-08-06T23:01:49.784005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-06T23:01:49.788445Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.788445Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:e980b38d599198064df336404b23abbb17e3a5946c3662dd9fb095dcce578429","observation_id":"5ce7e1ae-a651-46ff-b5e7-cbb259228f94","resolution":{"observed_at":"2026-08-06T23:01:49.788445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-06T23:01:49.793100Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.793100Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:112f66dafea4169dbf68f50f80374991e8875d114b9b147ad1f19f3592eb8080","observation_id":"ef4f571a-8c4f-4036-bd58-ec9d840575eb","resolution":{"observed_at":"2026-08-06T23:01:49.793100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T23:01:49.797577Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.797577Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:2b88fac0b135d8d03a8212c7bee69c149b8423ea4d6357afd3674a654b24b209","observation_id":"9780d705-0bc5-4c10-9ff9-0cdb2158c955","resolution":{"observed_at":"2026-08-06T23:01:49.797577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.801688Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.Advances in neural information processing systems, 37:84839–84865, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.801688Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:aca9c2b58fe066eed6fe860edef1bfdb391445d10ed222cb8a9418b025be07d3","observation_id":"61084d5c-aaa5-43f4-af9d-aa1f029122d5","resolution":{"observed_at":"2026-08-06T23:01:49.801688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-08T15:05:21.947334Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-06T23:01:49.805911Z","title":"Metamorph: Multimodal under- standing and generation via instruction tuning.arXiv preprint arXiv:2412.14164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.805911Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:c2c1e2433b64911c9f5b80c3ec0010cb5c7d2d282f78e85be03ce525fee704ce","observation_id":"7a2b6382-157a-4e49-9676-8fe6d40a94d6","resolution":{"observed_at":"2026-08-06T23:01:49.805911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.810741Z","title":"Neural discrete representation learning.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.810741Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:000d1aa24cbd2a5888d96c57b700cc6b6238c14e9a4044a0a3ee42042229ce9e","observation_id":"1e630c62-7010-4cd4-90b4-3c0407fe3f0f","resolution":{"observed_at":"2026-08-06T23:01:49.810741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-12T20:55:32.221193Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07538","snapshot_observed_at":"2026-08-06T23:01:49.815176Z","title":"Discrete visual tokens of autoregression, by diffusion, and for reasoning.arXiv preprint arXiv:2505.07538, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.815176Z"},"links":{"cited_paper":"/paper/2505.07538","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:fbecc234485af8348a3b2113e4fe9cd40097acc2ae31c66cfe21035724381c0f","observation_id":"5a97a6a8-26bc-4f56-9a80-f7f0ead67f4b","resolution":{"observed_at":"2026-08-06T23:01:49.815176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06673","last_updated":"2024-12-09T17:11:50Z","snapshot_observed_at":"2026-08-11T19:23:16.518889Z","submitted_at":"2024-12-09T17:11:50Z","title":"ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06673","snapshot_observed_at":"2026-08-06T23:01:49.819756Z","title":"Illume: Illuminating your llms to see, draw, and self-enhance.arXiv preprint arXiv:2412.06673, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.819756Z"},"links":{"cited_paper":"/paper/2412.06673","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:7dad5f99a0b83104e797403603694e86e745b93184b30b01af9158c1ae2d9a3a","observation_id":"8fe5a1de-7e37-4c94-9eb1-8fc0804bb377","resolution":{"observed_at":"2026-08-06T23:01:49.819756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.683808Z","title":"Omnitok- enizer: A joint image-video tokenizer for visual generation.Advances in Neural Information Processing Systems, 37:28281–28295, 2024","venue":null,"work_id":"1cd62a94-a1b7-46f7-b827-e9e0a35984ec","year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.824085Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:2d7a5b121a2077d5309bd12bad4b9607858a45d8d09d7437a96a07cfb5f14957","observation_id":"5e13fc24-4806-4e23-bae5-cebaa0c79874","resolution":{"observed_at":"2026-08-06T23:01:51.690847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.662699Z","title":"Image under- standing makes for a good tokenizer for image generation.Advances in Neural Information Processing Systems, 37:31015–31035, 2024","venue":null,"work_id":"1e73eb92-f310-4923-b4f5-29455140dda3","year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.828530Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:6ca6b7fe7c7559c884701090a8ada2aeca3d3b96a31cbc5427a1601215418f89","observation_id":"5a6f2efd-9e75-46b7-9c18-974d95f567e1","resolution":{"observed_at":"2026-08-06T23:01:51.670739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T23:01:49.832665Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.832665Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:6054d36c0c3736b722816cfcc3228ee10b305a6c8b4362975925e53e53b08f8d","observation_id":"7a8093d1-edb0-4dca-b5f1-fc8c28582e59","resolution":{"observed_at":"2026-08-06T23:01:49.832665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.837077Z","title":"Image as a foreign lan- guage: Beit pretraining for vision and vision-language tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.837077Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:16f690cc4d233019202b1c05def444db3f3f3c693eb06654b6877e81633f4268","observation_id":"638346e8-1ae3-4000-b244-7d8e29d0f2e1","resolution":{"observed_at":"2026-08-06T23:01:49.837077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-06T23:01:49.841242Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.841242Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:67ae337635dc08ff4b7d8c9a61a7c960d85a1e6e09c26ea112bb3fa82072d642","observation_id":"fb6c6446-7d35-42f3-9ac2-a12b09e0ca80","resolution":{"observed_at":"2026-08-06T23:01:49.841242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-06T23:01:49.845919Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation.arXiv preprint arXiv:2410.13848, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.845919Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:2cc5271de54fb5ee0e80f31b3c7e70ce47eb1bc0eca0aaf1bd5428cffb660167","observation_id":"5d49eb60-9db7-43d2-894d-a55ed865ddb7","resolution":{"observed_at":"2026-08-06T23:01:49.845919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-13T14:27:40.753031Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-06T23:01:49.850509Z","title":"Liquid: Language models are scalable multi-modal generators.arXiv preprint arXiv:2412.04332, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.850509Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:3878601d5f663e876279568fb5d8777fec91fb5d881b67476446d6545d636e04","observation_id":"fa027142-f6a4-4ae2-bfcd-7fbd7e199ab2","resolution":{"observed_at":"2026-08-06T23:01:49.850509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.629774Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"0fcc1c3d-666d-4ba1-9eef-d8c7b616bfae","year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.854970Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:279a720ef27411ca73598ab9718605f371ee081cc1181ebe8614d53a9e6c63cf","observation_id":"4640a3a0-953a-4ead-be75-c1d4759418dc","resolution":{"observed_at":"2026-08-06T23:01:51.636941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21979","last_updated":"2025-04-22T04:26:58Z","snapshot_observed_at":"2026-08-07T16:31:36.925232Z","submitted_at":"2025-03-27T20:50:38Z","title":"Harmonizing Visual Representations for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21979","snapshot_observed_at":"2026-08-06T23:01:49.859294Z","title":"Harmonizing visual representations for unified multimodal understanding and generation.arXiv preprint arXiv:2503.21979, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.859294Z"},"links":{"cited_paper":"/paper/2503.21979","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:609e46007cb012229381994ea6e0ae15ad568f82b9460285e1430df3211abcd4","observation_id":"58a09def-c607-40c0-b40f-9ea28861d1b1","resolution":{"observed_at":"2026-08-06T23:01:49.859294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-06T23:01:49.863781Z","title":"Vila-u: a unified foundation model integrating visual understanding and generation.arXiv preprint arXiv:2409.04429, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.863781Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:cc1be9221ce2ca840f1a600345e6c633eef726f4f168b9d6441bb9f148d34f87","observation_id":"94a77910-e224-46a6-a252-85d2bdc4603f","resolution":{"observed_at":"2026-08-06T23:01:49.863781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.608339Z","title":"Grok-1.5 vision preview, 6 2024","venue":null,"work_id":"694a8af9-3f1a-4d5c-a023-c189fefe0bf8","year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.868739Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:039ca8e7e16e5a7a7b085b57173eb21023122835fb3c16607fcfed6dca86885d","observation_id":"f5143d83-63be-4c9c-be19-75acb5c5b9d2","resolution":{"observed_at":"2026-08-06T23:01:51.616407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-08-14T06:13:17.008769Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-08-06T23:01:49.873348Z","title":"Omnigen: Unified image generation.arXiv preprint arXiv:2409.11340, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.873348Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:ac8564af9a920ce66a3484e338752552b555b26f6b2069106dff7fcfea656e98","observation_id":"0c1d8e90-0ad1-47b6-9d5e-1fdb31e97b4f","resolution":{"observed_at":"2026-08-06T23:01:49.873348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-06T23:01:49.878313Z","title":"Show-o: One single trans- former to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.878313Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:76775402f661c0f8fa70a5d4c42fa65c35d1df25c96a177138f5463825d594b8","observation_id":"f267fa33-2a43-494f-843e-1cc236f425db","resolution":{"observed_at":"2026-08-06T23:01:49.878313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17762","last_updated":"2025-07-28T09:54:49Z","snapshot_observed_at":"2026-08-13T06:27:52.789046Z","submitted_at":"2024-11-26T03:33:52Z","title":"MUSE-VL: Modeling Unified VLM through Semantic Discrete Encoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17762","snapshot_observed_at":"2026-08-06T23:01:49.883147Z","title":"Muse-vl: Modeling unified vlm through semantic discrete encoding.arXiv preprint arXiv:2411.17762, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.883147Z"},"links":{"cited_paper":"/paper/2411.17762","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:0532217ad40a491007a962409ea8623c76fc61a27e18fc98b42f1ddc57466837","observation_id":"eca16e4f-e042-4a5e-9470-7a5a5991c70b","resolution":{"observed_at":"2026-08-06T23:01:49.883147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.588092Z","title":"Efficientsam: Leveraged masked image pretraining for efficient segment anything","venue":null,"work_id":"301d8c78-578f-480c-a088-e516ef0267b4","year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.887716Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:57bd29b14d17cd9358bb8f28c13530977430eecc547c41164d0a90329f3c5c2a","observation_id":"1e4c5d69-034a-48fb-8da2-858ccd1c4813","resolution":{"observed_at":"2026-08-06T23:01:51.595479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T23:01:49.891862Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.891862Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:829c002a4871701db81cc9d8c931267e9f9685748e407f41c51f336ec4bfd9bf","observation_id":"1095fca2-3ae7-4175-a3c6-136135bc4670","resolution":{"observed_at":"2026-08-06T23:01:49.891862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-08-13T12:11:58.325060Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-06T23:01:49.896781Z","title":"Vector-quantized image modeling with improved vqgan.arXiv preprint arXiv:2110.04627, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.896781Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:af1c53e1f49d697ebdacebd0c6565b2a307760d34b335db6ac37c43ccc499db6","observation_id":"ec5bb5e2-5f5d-428a-98da-e6ec69ca4aac","resolution":{"observed_at":"2026-08-06T23:01:49.896781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-06T23:01:49.901168Z","title":"Language model beats diffusion–tokenizer is key to visual generation.arXiv preprint arXiv:2310.05737, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.901168Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:ec50e5c9b1d40dab2b0f7b8125c8f1938b87ba9ac43a71c6b22f642acdeb0569","observation_id":"29635d4e-8db5-4ee0-ab66-e5d08ade24e7","resolution":{"observed_at":"2026-08-06T23:01:49.901168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-06T23:01:49.905672Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.905672Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:922a45fc7724fda0ef0655f3ad142056cf96421612f21ee0d9eb1ac9b9d35add","observation_id":"a7f74818-5d00-4ea5-92df-f2b5ab82163e","resolution":{"observed_at":"2026-08-06T23:01:49.905672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.910134Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.910134Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:161106ddf86f3dad83863438524347542fecb5c362b7d4de045289a84bd16f83","observation_id":"cf029f21-64fd-48ee-a43b-14918d731c36","resolution":{"observed_at":"2026-08-06T23:01:49.910134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.914438Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.914438Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:1a87ce0ed3fbaaae776674a7c756b00b698c96f5aa511e5ec9a92f65fa2219a1","observation_id":"cf06dac7-6d75-4178-848f-b79dcaa58976","resolution":{"observed_at":"2026-08-06T23:01:49.914438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.16980","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:50.381906Z","title":"Token dynamics: Towards efficient and dynamic video token representation for video large language models.arXiv preprint arXiv:2503.16980, 2025","venue":null,"work_id":"e1cac6c1-6236-4863-89be-448861668ca1","year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.919010Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:eef5b167b2b6a078c6618682bf7454211e91e5aef8e2f81d698e47df59e1fdfc","observation_id":"7ffabdac-a96f-46a5-84fe-6fb89690a743","resolution":{"observed_at":"2026-08-06T23:01:50.399667Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.923951Z","title":"Unified multimodal understanding and generation models: Advances, challenges, and opportunities.arXiv preprint arXiv:2505.02567, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.923951Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:a327f1ba5b7904aa4d0e5e207d9892ea0e50320c209ad792aa1fbcbfc7b81e61","observation_id":"5b8708d8-348c-4e4b-9285-0ba2dd27d76a","resolution":{"observed_at":"2026-08-06T23:01:49.923951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-14T03:09:22.011333Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05178","snapshot_observed_at":"2026-08-06T23:01:49.928203Z","title":"Qlip: Text-aligned visual tokenization unifies auto-regressive multimodal understanding and generation.arXiv preprint arXiv:2502.05178, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.928203Z"},"links":{"cited_paper":"/paper/2502.05178","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:4155d2b0812f3686c45ad8d4173392a54cda5f0c3071d630f2ba170e16f456c6","observation_id":"cf687e1a-b5f5-4563-a753-5427cbecb4a8","resolution":{"observed_at":"2026-08-06T23:01:49.928203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.932726Z","title":"Online clustered codebook","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.932726Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:496e1fdc0964dd2717921737e93a104e1e35de8982691def4c165ceaf6795e0e","observation_id":"f4809218-b996-4377-b2ec-af22cdef42a5","resolution":{"observed_at":"2026-08-06T23:01:49.932726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-06T23:01:49.937018Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model.arXiv preprint arXiv:2408.11039, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.937018Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:0dcc12a39bcd1cff8e5e1d9b7b1bae237830bd69b4a55cec9ab47603f9e559cb","observation_id":"84e2bf29-c556-4028-856a-f85857f84d14","resolution":{"observed_at":"2026-08-06T23:01:49.937018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11837","last_updated":"2024-06-17T17:59:57Z","snapshot_observed_at":"2026-08-12T23:40:45.834749Z","submitted_at":"2024-06-17T17:59:57Z","title":"Scaling the Codebook Size of VQGAN to 100,000 with a Utilization Rate of 99%","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11837","snapshot_observed_at":"2026-08-06T23:01:49.941622Z","title":"Scaling the codebook size of vqgan to 100,000 with a utilization rate of 99%.arXiv preprint arXiv:2406.11837, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.941622Z"},"links":{"cited_paper":"/paper/2406.11837","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:e2e3eeb4352d1eb76b4d99a6fbcf0bbaac78a3607d1c5ee852dcd0bc28deca24","observation_id":"6459ee8c-5f34-43d2-9b3e-5fba6bd2d812","resolution":{"observed_at":"2026-08-06T23:01:49.941622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:49.946448Z","title":"Addressing representation collapse in vector quantized models with one linear layer.arXiv preprint arXiv:2411.02038, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.946448Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:de60596df739b8f3dc13cc77878dde33b6149895ad92b6484920e8ff658be3d0","observation_id":"caa43789-6d45-46a6-914e-9f32bf63ae11","resolution":{"observed_at":"2026-08-06T23:01:49.946448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08686","last_updated":"2025-03-11T17:59:46Z","snapshot_observed_at":"2026-08-07T17:12:09.182878Z","submitted_at":"2025-03-11T17:59:46Z","title":"OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08686","snapshot_observed_at":"2026-08-06T23:01:49.951366Z","title":"a blue pizza","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.951366Z"},"links":{"cited_paper":"/paper/2503.08686","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:49a96c24fa370f179160d48823c2cec98c7cb88ea1539f3568f36955243b554e","observation_id":"365b6c50-2d1c-47e0-a6eb-2cab4993cf8b","resolution":{"observed_at":"2026-08-06T23:01:49.951366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.527914Z","title":"Let E={e 1, ...,eN } ⊂Rd denote visual embeddings sampled from a distribution p(e), and let C={c 1, ...,cK} ⊂Rd be a codebook with K discrete centroids","venue":null,"work_id":"da90ff34-95bc-40e4-a95a-5c5a5b04c744","year":null},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.957273Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:3aeb45f00f9aa8bbdf9872a3e7479665677322b2fa2a9f72d56094bb6ed183be","observation_id":"bd75435d-6cf2-420b-88fc-211b99186a4d","resolution":{"observed_at":"2026-08-06T23:01:51.534554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.502528Z","title":null,"venue":null,"work_id":"0c87c0fb-0c59-4d08-850f-687482e56450","year":null},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.961746Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:99e06b1d6636a7eeaaac76ed44972e40ecc29aa4b8c59909ef90bd8a5a4c2ca3","observation_id":"5289fcf7-54c8-430d-9dd6-f00fb34f66e5","resolution":{"observed_at":"2026-08-06T23:01:51.513926Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.482462Z","title":"Let y be a semantic target label (e.g., object class, scene type), and let v=Q(e) be the discrete token assigned to embeddinge","venue":null,"work_id":"efcdceca-0ea7-4edc-8a71-265a48f2251c","year":null},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.966452Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:8fbcde45fa30a57986b4e9e67a96d506a82b6be64435bc2ef2224cf8e4ad0885","observation_id":"6c9382c1-2830-4073-8eae-1c713deb4564","resolution":{"observed_at":"2026-08-06T23:01:51.489877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.463866Z","title":null,"venue":null,"work_id":"aa7a7a52-b331-4305-97cf-1e4a10beecc7","year":null},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.971454Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:51da13207a0edfd30df0e4cc74857a315f878597f3d2ea40d51b138ead00a746","observation_id":"a003bd6f-da76-4860-be9c-742ba2295ec1","resolution":{"observed_at":"2026-08-06T23:01:51.469848Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:51.440762Z","title":null,"venue":null,"work_id":"e65f9665-e188-4b71-bd97-d493bab01676","year":null},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.976800Z"},"links":{"citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:c8eb5c854751b3cf0a975f32e4e95ed04c919f179719688d3b33cb152a6a858f","observation_id":"af3ee04e-8a70-4148-bbd3-d27b89482896","resolution":{"observed_at":"2026-08-06T23:01:51.448653Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation"},"reference_resolution":{"displayed":94,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":84,"verified_exact":1,"verified_fuzzy":9},"total_outbound_references":94},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 94 of 94 outbound references and 0 inbound Pith citation observations for arXiv:2506.20214."}