{"as_of":"2026-08-10T12:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dbf14a09a4644980c2cd39e67d3d9368c80acb0fa9d16a9b9950f481c0e4e679","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:08:56.594805Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T00:04:22.401157Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-08T15:24:46.446643Z","title":"Liquid: Language models are scalable multi-modal generators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-10T10:35:02.905372Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.446643Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:8978f4fe03827b95f901faf93b46c58f60de8ace368dfb3420ba665a83b2e7bf","observation_id":"8dd074de-e5b9-4644-b9b5-bd5ae90f6f6a","resolution":{"observed_at":"2026-08-08T15:24:46.446643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":"2412.04332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-07-08T00:04:22.401157Z","title":"arXiv preprint arXiv:2412.04332 (2024) 2, 9, 10","venue":"cs.CV","work_id":"a9ef7688-9d55-4c89-935a-8762165fc75f","year":2024},"citing_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T16:24:27.407376Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2503.07265"},"observation_digest":"sha256:27cec092a03429fc7e4241b9fe63fe519f7caf7ad0d61d49f656f5225575840c","observation_id":"9bbaf9aa-4ec2-4012-b95c-27c78871a41e","resolution":{"observed_at":"2026-05-15T16:24:27.491335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":"2412.04332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-07-08T00:04:22.401157Z","title":"arXiv preprint arXiv:2412.04332 (2024) 2, 9, 10","venue":"cs.CV","work_id":"a9ef7688-9d55-4c89-935a-8762165fc75f","year":2024},"citing_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-17T07:24:04.460276Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2505.05472"},"observation_digest":"sha256:22a1352a54654d0e0588ec26cd7d7393a00a594bebe41e3bc7e1ce8e869180b5","observation_id":"ce410087-09ce-4ded-974b-f0731aa4b796","resolution":{"observed_at":"2026-05-17T07:24:04.698301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":"2412.04332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-07-08T00:04:22.401157Z","title":"arXiv preprint arXiv:2412.04332 (2024) 2, 9, 10","venue":"cs.CV","work_id":"a9ef7688-9d55-4c89-935a-8762165fc75f","year":2024},"citing_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:41.854132Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2505.14683"},"observation_digest":"sha256:c016aaec8e7f136b1713b84eef6abe109b57707c35886661b9e1d8708c1b084e","observation_id":"67e2ff16-9551-4c35-a2cc-7fc008b4854b","resolution":{"observed_at":"2026-05-10T16:23:42.041939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-07T14:37:43.966306Z","title":"Liquid: Language models are scalable multi-modal generators.arXiv preprint arXiv:2412.04332, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:43.966306Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:755219dbaaa341d4d7f5eca214dc96be2bfbdd13a9b085fa005f6b6df3c15f00","observation_id":"547639b4-fe7c-403f-be0c-81d633721b56","resolution":{"observed_at":"2026-08-07T14:37:43.966306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-07T13:00:58.581514Z","title":"Liquid: Language models are scalable and unified multi-modal generators.arXiv preprint arXiv:2412.04332, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.581514Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:d8200806f4592e2a0e8e5c6a4a94e88bbc2d650fed9b5912a5f1d6c402705f69","observation_id":"88636981-0a87-40b5-98da-fadb43d3c281","resolution":{"observed_at":"2026-08-07T13:00:58.581514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-07T12:53:26.366317Z","title":"Liquid: Language models are scalable multi-modal generators.CoRR, abs/2412.04332, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-09T02:35:27.089432Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:26.366317Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:483f7ad9dfad275ab8290367cf034810d543a44510c3da6a54ede85c218b8734","observation_id":"e308dcb7-501d-44bf-9a0f-d4708432b45f","resolution":{"observed_at":"2026-08-07T12:53:26.366317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":"2412.04332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-07-08T00:04:22.401157Z","title":"arXiv preprint arXiv:2412.04332 (2024) 2, 9, 10","venue":"cs.CV","work_id":"a9ef7688-9d55-4c89-935a-8762165fc75f","year":2024},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:a85d8eeed2e625a84b596a21c610856a67de974ca36edf030eb21d25b15bd36e","observation_id":"09c1505d-c155-403f-a089-bbac8913b2f5","resolution":{"observed_at":"2026-05-12T18:51:15.779964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-06T23:01:49.850509Z","title":"Liquid: Language models are scalable multi-modal generators.arXiv preprint arXiv:2412.04332, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.850509Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:06bc241279001ad19f3853c994f4cfd6d6ca61e9a80de32e8b08fae879d6f17b","observation_id":"fa027142-f6a4-4ae2-bfcd-7fbd7e199ab2","resolution":{"observed_at":"2026-08-06T23:01:49.850509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-06T22:43:04.510524Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21022","last_updated":"2025-06-26T05:48:36Z","snapshot_observed_at":"2026-08-07T15:30:22.761798Z","submitted_at":"2025-06-26T05:48:36Z","title":"Instella-T2I: Pushing the Limits of 1D Discrete Latent Space Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:43:04.510524Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2506.21022"},"observation_digest":"sha256:06d1b962d9881c3345d86358257ae11aaa91a8fa7e0663d4d384d4a410ff8d29","observation_id":"e7393e11-46e1-4417-b8ef-3e01f8a137b6","resolution":{"observed_at":"2026-08-06T22:43:04.510524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-04T22:36:08.238282Z","title":"Liquid: Language models are scalable multi-modal generators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-04T22:36:03.033298Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-04T22:36:08.238282Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2509.07295"},"observation_digest":"sha256:63ed7954f31f30485a07d3be145c40582bb3172977b1ffe07ab88392acd8daad","observation_id":"5afcd07c-6d9f-464d-8890-d84d5122f57b","resolution":{"observed_at":"2026-08-04T22:36:08.238282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-03T18:57:00.890684Z","title":"Liquid: Language models are scalable and unified multi-modal generators.arXiv preprint arXiv:2412.04332, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-06T15:38:52.220151Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:00.890684Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:fb8acbef30d31bc7978a685753ed6b0aece491cfc2c91191f6e7275a5a0aff99","observation_id":"b540e1e8-a5c9-400e-a37f-a14975165cb7","resolution":{"observed_at":"2026-08-03T18:57:00.890684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":"2412.04332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-07-08T00:04:22.401157Z","title":"arXiv preprint arXiv:2412.04332 (2024) 2, 9, 10","venue":"cs.CV","work_id":"a9ef7688-9d55-4c89-935a-8762165fc75f","year":2024},"citing_paper":{"arxiv_id":"2604.10949","last_updated":"2026-04-13T03:46:45Z","snapshot_observed_at":"2026-08-02T17:46:44.490061Z","submitted_at":"2026-04-13T03:46:45Z","title":"Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T16:27:14.491492Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2604.10949"},"observation_digest":"sha256:0cb47ac25ee0ec5ec8d9d47c877ffa012e5584148b2606cc46354f13093a3ec3","observation_id":"ed2cb239-2d97-4609-b8e9-b737b8539c91","resolution":{"observed_at":"2026-05-11T08:50:59.197308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":"2412.04332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-07-08T00:04:22.401157Z","title":"arXiv preprint arXiv:2412.04332 (2024) 2, 9, 10","venue":"cs.CV","work_id":"a9ef7688-9d55-4c89-935a-8762165fc75f","year":2024},"citing_paper":{"arxiv_id":"2605.18115","last_updated":"2026-05-18T09:24:39Z","snapshot_observed_at":"2026-08-06T04:43:08.432770Z","submitted_at":"2026-05-18T09:24:39Z","title":"WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-20T12:04:19.761430Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2605.18115"},"observation_digest":"sha256:0e51e2157db6d15ee8f2dd07dc5f647e1297092aba07afe6f1902fc4110c8e24","observation_id":"45accae2-06e0-437a-a0c2-3dc9140cdc29","resolution":{"observed_at":"2026-05-20T12:08:15.782804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":"2412.04332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-07-08T00:04:22.401157Z","title":"arXiv preprint arXiv:2412.04332 (2024) 2, 9, 10","venue":"cs.CV","work_id":"a9ef7688-9d55-4c89-935a-8762165fc75f","year":2024},"citing_paper":{"arxiv_id":"2606.01503","last_updated":"2026-05-31T23:59:12Z","snapshot_observed_at":"2026-08-08T19:11:13.427121Z","submitted_at":"2026-05-31T23:59:12Z","title":"On the Limits of Token Reduction for Efficient Unified Vision Language Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T16:57:56.333595Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2606.01503"},"observation_digest":"sha256:8ab4558fa5ce626f1b017588533aac4eccc0282cd6f2cc6e026510517ffb2ca6","observation_id":"510d55b9-c96c-44f8-8248-8422ac28ebf1","resolution":{"observed_at":"2026-06-28T17:02:24.295561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":"2412.04332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-07-08T00:04:22.401157Z","title":"arXiv preprint arXiv:2412.04332 (2024) 2, 9, 10","venue":"cs.CV","work_id":"a9ef7688-9d55-4c89-935a-8762165fc75f","year":2024},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:c07d4174e166e7277e5fbedf97aae1ab0e5fb872face662c1147be9192e20aab","observation_id":"0c738ec6-7764-4a1d-a5fd-22cfe2530c27","resolution":{"observed_at":"2026-07-03T14:38:28.909508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":"2412.04332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-07-08T00:04:22.401157Z","title":"arXiv preprint arXiv:2412.04332 (2024) 2, 9, 10","venue":"cs.CV","work_id":"a9ef7688-9d55-4c89-935a-8762165fc75f","year":2024},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-09T15:40:13.197295Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":137,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:20f6dc14ef07008e10ae8bc89a62449d246b19c9bb9de677ecf049a8d8a6afb3","observation_id":"8f2c5e0c-af6d-4e79-b120-7b19fba7d402","resolution":{"observed_at":"2026-07-08T00:04:22.402454Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2412.04332 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-09T15:40:13.197295Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":137,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:7793833fc6c9dfaf91c6e5cabcd556284145d33dcd083ea622c8db84b08fefb9","observation_id":"4b2703cb-d4f9-48e6-a5af-b518d68a27a4","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-01T04:29:51.029704Z","title":"arXiv preprint arXiv:2412.04332 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22531","last_updated":"2026-07-24T17:59:39Z","snapshot_observed_at":"2026-08-07T13:04:18.211748Z","submitted_at":"2026-07-24T17:59:39Z","title":"Twins: Learn to Predict Unified Representations with Focal Loss","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-01T04:29:51.029704Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2607.22531"},"observation_digest":"sha256:40e97c9aed403af97f1bb372dd66a43306df413228e45e90798e5ef9b947515e","observation_id":"385d2136-e0a2-4319-94e1-3412150f6711","resolution":{"observed_at":"2026-08-01T04:29:51.029704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-01T02:14:09.687868Z","title":"arXiv preprint arXiv:2412.04332 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.687868Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:d12583ac3f18e7c96509c624b94104a044d808a0fecdcecda31287c48192fabd","observation_id":"2ef15d77-cc04-4d18-80d0-a35ec502ee27","resolution":{"observed_at":"2026-08-01T02:14:09.687868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-06T11:55:28.167608Z","title":"Liquid: Language models are scalable and unified multi-modal generators.arXiv preprint arXiv:2412.04332, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T23:12:27.682802Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":1},"reference_index":138,"source":"pdf_text","source_observed_at":"2026-08-06T11:55:28.167608Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:7eeacb196a8461b91c624ff3c04eef9536c7d7bbb9f63ddbbd903de278ccdae2","observation_id":"06fe37aa-195e-4ebb-95c9-68e02a64175f","resolution":{"observed_at":"2026-08-06T11:55:28.167608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-08T17:08:56.594805Z","title":"Liquid: Language models are scalable and unified multi-modal generators.arXiv preprint arXiv:2412.04332, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T23:12:27.682802Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":2},"reference_index":138,"source":"pdf_text","source_observed_at":"2026-08-08T17:08:56.594805Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:5f74f08a7f8a562c30890a674d486fa8211f1f5e1b96bdfb9f418cd9aa485950","observation_id":"b87b291e-b14d-41af-a597-767d3bd51e63","resolution":{"observed_at":"2026-08-08T17:08:56.594805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.04332/citation-record","integrity":"/paper/2412.04332/integrity","json":"/paper/2412.04332/citation-record.json","paper":"/paper/2412.04332"},"outbound":[],"paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2412.04332."}