{"as_of":"2026-08-13T17:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e09f59ef20708d6753a04f477c08ab5bbbe851227c5d466de6fca159dfeb6c26","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:00:59.644394Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:08:56.973761Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T00:04:22.359705Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2505.23043","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23043","snapshot_observed_at":"2026-07-08T00:04:22.359705Z","title":"Are unified vision- language models necessary: Generalization across understanding and generation","venue":"cs.CV","work_id":"64efbe94-8d1a-4427-a30b-28e6a0e39294","year":2025},"citing_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-08-12T23:49:38.644434Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-12T17:34:26.951644Z"},"links":{"cited_paper":"/paper/2505.23043","citing_paper":"/paper/2506.03147"},"observation_digest":"sha256:818e828701a504a11d6b77c5874aa68f71e51f5b4afd0f5e77c27ca745431031","observation_id":"844b3e6a-ea89-4fc1-b5cf-a92b9f6d2639","resolution":{"observed_at":"2026-05-12T17:34:27.086711Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23043","snapshot_observed_at":"2026-08-06T19:14:06.879405Z","title":"Are unified vision-language models necessary: Generalization across understanding and generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06167","last_updated":"2025-07-10T15:41:04Z","snapshot_observed_at":"2026-08-07T10:37:03.707334Z","submitted_at":"2025-07-08T16:47:16Z","title":"Skywork-R1V3 Technical Report","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T19:14:06.879405Z"},"links":{"cited_paper":"/paper/2505.23043","citing_paper":"/paper/2507.06167"},"observation_digest":"sha256:8f45522e32d49a6e5a070edc53f9476fcb61c9beae502e9cc35554c654bf15fc","observation_id":"bfbb7e93-76ba-4638-918e-68d65e3803b1","resolution":{"observed_at":"2026-08-06T19:14:06.879405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23043","snapshot_observed_at":"2026-08-03T17:06:58.520524Z","title":"Are unified vision-language models necessary: Generalization across understanding and generation.arXiv preprint arXiv:2505.23043, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-13T13:59:05.187739Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.520524Z"},"links":{"cited_paper":"/paper/2505.23043","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:a33ee3e3a45a6f14702a7da4ed4a42a49c0172cf004a800d1948c0d6723a9c02","observation_id":"46b1327c-347f-44a8-ab5b-a159e9c18129","resolution":{"observed_at":"2026-08-03T17:06:58.520524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23043","snapshot_observed_at":"2026-07-11T19:17:19.634242Z","title":"arXiv preprint arXiv:2505.23043 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04423","last_updated":"2026-07-07T07:27:22Z","snapshot_observed_at":"2026-08-04T06:57:07.480777Z","submitted_at":"2026-07-05T17:33:59Z","title":"Transferability Between Understanding and Generation in Unified Multimodal Models","version":2},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-07-11T19:17:19.634242Z"},"links":{"cited_paper":"/paper/2505.23043","citing_paper":"/paper/2607.04423"},"observation_digest":"sha256:837aefdf7892bf6a7d99ebb868cba0fbb28ccd83dc8e3246a9e3db812908b67a","observation_id":"90b13ec3-a465-48dd-ba92-993348a6ce22","resolution":{"observed_at":"2026-07-11T19:17:19.634242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2505.23043","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23043","snapshot_observed_at":"2026-07-08T00:04:22.359705Z","title":"Are unified vision- language models necessary: Generalization across understanding and generation","venue":"cs.CV","work_id":"64efbe94-8d1a-4427-a30b-28e6a0e39294","year":2025},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-09T15:40:13.197295Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":261,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2505.23043","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:394c927ab5e3c5d4f5a34dd9cb102f317d664ea0ab691e4fdc1c1f5abdee2a58","observation_id":"3739057f-d01c-45e9-a4a0-4a849778039b","resolution":{"observed_at":"2026-07-08T00:04:22.360990Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23043","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2505.23043 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-09T15:40:13.197295Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":261,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2505.23043","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:a853fd101c925ac09ea9eb61c6014f2fcbe034fcb46c3bdd1dab6167645e6f1f","observation_id":"e2ee9f89-6e09-4582-958a-ab9830eeb666","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23043","snapshot_observed_at":"2026-08-06T11:55:28.215574Z","title":"Are unified vision-language models necessary: Generalization across understanding and generation.arXiv preprint arXiv:2505.23043, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T23:12:27.682802Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":1},"reference_index":156,"source":"pdf_text","source_observed_at":"2026-08-06T11:55:28.215574Z"},"links":{"cited_paper":"/paper/2505.23043","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:8ebee0cbdbd4143876c91c705196eab2e736b1c2972d92446df31f9a4d06f072","observation_id":"13e1738b-ddd8-4ed3-877e-099c2c1db321","resolution":{"observed_at":"2026-08-06T11:55:28.215574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23043","snapshot_observed_at":"2026-08-08T17:08:56.973761Z","title":"Are unified vision-language models necessary: Generalization across understanding and generation.arXiv preprint arXiv:2505.23043, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T23:12:27.682802Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":2},"reference_index":156,"source":"pdf_text","source_observed_at":"2026-08-08T17:08:56.973761Z"},"links":{"cited_paper":"/paper/2505.23043","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:0070f13404a2afea3c05aea9c48ad91e3e38b67547cfc0a1623e7202c1dfc0ab","observation_id":"54ddf904-8025-4371-bf60-a34609ceaede","resolution":{"observed_at":"2026-08-08T17:08:56.973761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23043/citation-record","integrity":"/paper/2505.23043/integrity","json":"/paper/2505.23043/citation-record.json","paper":"/paper/2505.23043"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T13:00:57.690899Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.690899Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:18de13b6e01118d8103cb90cb5229911be5ce60c7f73456cb23fd954dba95c3f","observation_id":"1633aeeb-f418-4f81-ad87-d005d7b4126e","resolution":{"observed_at":"2026-08-07T13:00:57.690899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T13:00:57.923032Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.923032Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:dbeba957d527c06d10a952f6e752ce54582c2bfbdd19ea388e48bdd000120fb5","observation_id":"82528c4f-51c5-4214-9f6a-e7557d20293d","resolution":{"observed_at":"2026-08-07T13:00:57.923032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T13:00:58.044538Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.Advances in neural information processing systems, 37:84839–84865, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.044538Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:90b09b1d613a957cea7598e09f82d257228756e758f36f7e782987111ea2b8b6","observation_id":"cb0105ff-ebfd-4517-88d0-7522bd9265c6","resolution":{"observed_at":"2026-08-07T13:00:58.044538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T13:00:58.375909Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.375909Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:8d25a413330ba17415b40ccd0e3495d0fd46b887b999c7721f6b5ddfe6d98a4c","observation_id":"e97a0651-39e3-4f7a-bef6-fdb932b66777","resolution":{"observed_at":"2026-08-07T13:00:58.375909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-08T15:05:21.947334Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-07T13:00:58.491677Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning.arXiv preprint arXiv:2412.14164,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.491677Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:8d179f1930e8c0a5679715d97e1f84d9685a31c34a9fef17c11169679bae970c","observation_id":"99aaf820-8c5e-4420-8422-7c36a7c5b90e","resolution":{"observed_at":"2026-08-07T13:00:58.491677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-13T14:27:40.753031Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-07T13:00:58.581514Z","title":"Liquid: Language models are scalable and unified multi-modal generators.arXiv preprint arXiv:2412.04332, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.581514Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:0b4206bf72520ebe72f514de6d0146926a7235140a1db9e597792c4cebb8d2a1","observation_id":"88636981-0a87-40b5-98da-fadb43d3c281","resolution":{"observed_at":"2026-08-07T13:00:58.581514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-08-13T04:39:37.073819Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-08-07T13:00:58.779890Z","title":"Mm-interleaved: Interleaved image-text generative modeling via multi-modal feature synchronizer.arXiv preprint arXiv:2401.10208, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.779890Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:f4c4d60f3b3dafbf4e06ce54d22375b009f380ebafc33fc46ca404a1f8fb5fef","observation_id":"f5a6238d-09c5-477c-81d2-1735344b6635","resolution":{"observed_at":"2026-08-07T13:00:58.779890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-07T13:00:58.920678Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.920678Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:5dd76314449250563a10af8cc6e8fae030946d6c4d5adc13c957b025a853c661","observation_id":"e9ed10ee-6de4-4cfc-bbad-9cbcf6387e45","resolution":{"observed_at":"2026-08-07T13:00:58.920678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-07T13:00:59.061087Z","title":"Instruction tuning with gpt-4.arXiv preprint arXiv:2304.03277,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.061087Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:833feafe0bde5d9fd1a0c556d94fa670d3218bbc545a9b392a2ea04f84918984","observation_id":"c8bc3102-07b3-4228-a66a-a07cca591a52","resolution":{"observed_at":"2026-08-07T13:00:59.061087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-07T13:00:59.135161Z","title":"Sharegpt4v: Improving large multi-modal models with better captions.arXiv preprint arXiv:2311.12793,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.135161Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:f095af3129f7f128efb447e23c2a81cf5a4f4602c9265e767f11df8851a65b3b","observation_id":"485851a2-adb4-4330-affd-9aa9646c0757","resolution":{"observed_at":"2026-08-07T13:00:59.135161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:59.934453Z","title":"Lmms- eval: accelerating the development of large multimoal models (2024).URL: https://github","venue":null,"work_id":"4c37054d-7897-44d5-ba02-16d763af0706","year":2024},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.224555Z"},"links":{"citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:4dad1a628bee52d6fa0bfd65981d1c2fd6ef535b1c3e4a8d079e08559b628438","observation_id":"de8b0986-ae8e-4247-9022-ae1ddb487e73","resolution":{"observed_at":"2026-08-07T13:00:59.992004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T13:00:59.314486Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.314486Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:7b3d1cbb2dee4782530907fb7d6f3f14801cd40ce8295fc2623f0ac055fcc916","observation_id":"94957f9f-b3b4-43be-a67e-93cdd9612117","resolution":{"observed_at":"2026-08-07T13:00:59.314486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T13:00:59.421149Z","title":"Are we on the right way for evaluating large vision-language models?arXiv preprint arXiv:2403.20330, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.421149Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:ef22d8b0eeb4d05bd02a51c2978db234ae92d938d64569dcd313cd96025b8fcd","observation_id":"d04638e1-b8f4-44e1-a21e-6c2e57cbda22","resolution":{"observed_at":"2026-08-07T13:00:59.421149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T13:00:59.532990Z","title":"Evaluating object hallucination in large vision-language models.arXiv preprint arXiv:2305.10355,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.532990Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:19d81654c8a3b28eb8bdf42690c1eaa8beaaf755c7203c404c5713f4a39f069c","observation_id":"1136db49-8e14-48c3-8528-270948dfa0b4","resolution":{"observed_at":"2026-08-07T13:00:59.532990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:59.819309Z","title":"_u” refers to understanding-only; “_g","venue":null,"work_id":"97d56890-4b79-4ab7-ac4b-dacae6393270","year":2022},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":393,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:59.644394Z"},"links":{"citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:0eee066f635ed5b5698c1cecacd0f0cda3a8577ec8fbb41136eb2f45fce21da5","observation_id":"e4721438-4639-474b-b2f0-1b4b5fca92fc","resolution":{"observed_at":"2026-08-07T13:00:59.855360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-12T17:57:54.262483Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T13:00:58.975213Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.975213Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:4828b5b7157cad7e32c5492566bf191d44536a3d58c703353794a7620afe25a4","observation_id":"bcf40dac-dd34-4641-9038-bc2f8d4cb9c7","resolution":{"observed_at":"2026-08-07T13:00:58.975213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-13T10:09:02.594270Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-07T13:00:58.701131Z","title":"Dreamllm: Synergistic multimodal comprehension and creation.arXiv preprint arXiv:2309.11499,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.701131Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:3b84edb440075e938681500f44b3f29866ef6b0af037c477aa67f8171807e7b7","observation_id":"f0c5e914-991b-4de0-87ea-f8c90b403eca","resolution":{"observed_at":"2026-08-07T13:00:58.701131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:00:57.782523Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.782523Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:b6645f457341ee363fddc51c161a947ef081414427cb1506182d4b0a9918ddf3","observation_id":"a3ee0b67-963b-4bf2-8664-3c3fbb24b85e","resolution":{"observed_at":"2026-08-07T13:00:57.782523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-07T13:00:58.276354Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model.arXiv preprint arXiv:2408.11039,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.276354Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:fc1dad58d2aee91384d100993fecd0f14151486968f6c21a5f7469b08b988dce","observation_id":"369ca1a0-1eff-4d6e-8cc4-9fbe475d1db6","resolution":{"observed_at":"2026-08-07T13:00:58.276354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T13:00:58.148282Z","title":"Show-o: One single transformer to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:58.148282Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:c5e06f677d4aea55048f28a6ee0927dccb93d71ec22cc495128f4cc1434bfab3","observation_id":"69654701-8958-473e-93a8-dc96e7cd432a","resolution":{"observed_at":"2026-08-07T13:00:58.148282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 8 inbound Pith citation observations for arXiv:2505.23043."}