{"as_of":"2026-08-18T15:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:89c1c5327b870aafe95c93741db581938cbec1900103fc285438b3338e3b6059","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:54:39.455447Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:09:10.602355Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T10:14:36.390338Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02471","snapshot_observed_at":"2026-08-15T23:09:10.602355Z","title":"Ming-lite-uni: Advancements in unified architecture for natural multimodal interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05422","last_updated":"2025-08-15T08:56:27Z","snapshot_observed_at":"2026-08-16T05:36:45.421294Z","submitted_at":"2025-05-08T17:12:19Z","title":"TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T23:09:10.602355Z"},"links":{"cited_paper":"/paper/2505.02471","citing_paper":"/paper/2505.05422"},"observation_digest":"sha256:80c2ab076352a40b883162523d38f71bdaa4e54c7cb2ec6c92cae866bae38fe8","observation_id":"0f86ad23-5b73-4336-9338-cafb70f497e2","resolution":{"observed_at":"2026-08-15T23:09:10.602355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02471","snapshot_observed_at":"2026-08-07T04:58:08.031807Z","title":"Ming-lite-uni: Advancements in unified architecture for natural multimodal interaction, 2025.https://arxiv.org/abs/2505.02471","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:08.031807Z"},"links":{"cited_paper":"/paper/2505.02471","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:d3c927f029ef380352d0cbeae6237356dec93c8940e4ba9a5d2e14bab33f393d","observation_id":"852eed35-e376-4708-b0b5-c93c3bc3d385","resolution":{"observed_at":"2026-08-07T04:58:08.031807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"cited_work":{"arxiv_id":"2505.02471","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02471","snapshot_observed_at":"2026-06-30T10:14:36.390338Z","title":"Ming-lite-uni: Advancements in unified architecture for natural multimodal interaction","venue":null,"work_id":"823e8d54-5567-41b0-856d-244aff7440e8","year":2025},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2505.02471","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:965ef302d73e9cdfca64a65011104ca98a439b1c7918e46e040cf799cfe10164","observation_id":"7f1a83b4-29cc-407a-a24e-a653f0a7658d","resolution":{"observed_at":"2026-05-12T18:51:15.522086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02471","snapshot_observed_at":"2026-08-06T22:01:19.342279Z","title":"Ming-Lite-Uni: Advancements in unified architecture for natural multimodal interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:19.342279Z"},"links":{"cited_paper":"/paper/2505.02471","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:e357c9c1b3ecf3357ed06b0a2968e45ca921dc45b479e0442ecdf9e10decb625","observation_id":"1dee3b2c-2436-46d1-b713-42165f67ae27","resolution":{"observed_at":"2026-08-06T22:01:19.342279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"cited_work":{"arxiv_id":"2505.02471","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02471","snapshot_observed_at":"2026-06-30T10:14:36.390338Z","title":"Ming-lite-uni: Advancements in unified architecture for natural multimodal interaction","venue":null,"work_id":"823e8d54-5567-41b0-856d-244aff7440e8","year":2025},"citing_paper":{"arxiv_id":"2606.28696","last_updated":"2026-06-27T02:43:13Z","snapshot_observed_at":"2026-08-16T23:26:35.561931Z","submitted_at":"2026-06-27T02:43:13Z","title":"COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T10:10:59.772213Z"},"links":{"cited_paper":"/paper/2505.02471","citing_paper":"/paper/2606.28696"},"observation_digest":"sha256:9cac896581352762422f91fa4c1f157e2c70b0e61eb574a90ef44ecd3d9a4947","observation_id":"6e916f84-6f38-4312-a1a8-7c4776b83c41","resolution":{"observed_at":"2026-06-30T10:14:36.391848Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.02471/citation-record","integrity":"/paper/2505.02471/integrity","json":"/paper/2505.02471/citation-record.json","paper":"/paper/2505.02471"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-16T00:54:39.339076Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.339076Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:325ec1a273c86ee9db5ee99eeaeeb3424f6aa25a58484fc37067dc7d065178e3","observation_id":"e3a8079f-2ba1-4a64-ab8c-49d248cf4303","resolution":{"observed_at":"2026-08-16T00:54:39.339076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-16T00:54:39.353385Z","title":"Are we on the right way for evaluating large vision-language models?arXiv preprint arXiv:2403.20330, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.353385Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:6239656aacd03875a097691a674a2e8973bcf68a497922f25eb8f4ffdb7a9ba8","observation_id":"ef926333-3983-4983-b9c7-a0d60bb6ccf0","resolution":{"observed_at":"2026-08-16T00:54:39.353385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T00:54:39.366368Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.366368Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:ebaecd4c435c11d0597b1672c4596ca1bfb91f167e7d98004ade70e13b841b3e","observation_id":"abd70fd0-503e-4813-a90e-570e0000ec4c","resolution":{"observed_at":"2026-08-16T00:54:39.366368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-08-13T01:47:21.043519Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-16T00:54:39.371003Z","title":"Scaling rectified flow transformers for high-resolution image synthesis, 2024.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.371003Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:8139930d4f6ca2993ff0764152d6cd4be5136870fe6e7fc13a155137b46bb115","observation_id":"d9d01adb-87a0-4281-b82c-8e56d7a8b7ed","resolution":{"observed_at":"2026-08-16T00:54:39.371003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04007","last_updated":"2024-05-07T04:55:47Z","snapshot_observed_at":"2026-08-16T13:54:49.928296Z","submitted_at":"2024-05-07T04:55:47Z","title":"SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04007","snapshot_observed_at":"2026-08-16T00:54:39.374968Z","title":"Seed-data-edit technical report: A hybrid dataset for instructional image editing.arXiv preprint arXiv:2405.04007, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.374968Z"},"links":{"cited_paper":"/paper/2405.04007","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:fadc0fcefb39d69a078003e1a8aee75e8fb8efb989a857ec63b8ccf467fba378","observation_id":"e274d37d-91eb-463a-b35c-cd90b5fcb38e","resolution":{"observed_at":"2026-08-16T00:54:39.374968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18778","last_updated":"2025-04-07T08:54:28Z","snapshot_observed_at":"2026-08-16T12:55:09.792048Z","submitted_at":"2025-02-26T03:21:12Z","title":"M2-omni: Advancing Omni-MLLM for Comprehensive Modality Support with Competitive Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18778","snapshot_observed_at":"2026-08-16T00:54:39.378812Z","title":"M2-omni: Advancing omni-mllm for comprehensive modality support with competitive performance.arXiv preprint arXiv:2502.18778,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.378812Z"},"links":{"cited_paper":"/paper/2502.18778","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:3cc1ee7f369632322b6a328386722da43d7a2e801d3542fe065accfc6dbebb60","observation_id":"b18414f7-39bf-48c1-bd1a-21aa459c2f17","resolution":{"observed_at":"2026-08-16T00:54:39.378812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12154","last_updated":"2024-12-15T15:31:56Z","snapshot_observed_at":"2026-08-16T13:59:46.348617Z","submitted_at":"2024-04-18T12:58:55Z","title":"StyleBooth: Image Style Editing with Multimodal Instruction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12154","snapshot_observed_at":"2026-08-16T00:54:39.382829Z","title":"Stylebooth: Image style editing with multimodal instruction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.382829Z"},"links":{"cited_paper":"/paper/2404.12154","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:1c062a2bf790f82d9a39ab27161a56692f2ea892d338a725054e2b9723009863","observation_id":"e8bb5452-01fa-4d2e-b207-7b53b4fd7bf9","resolution":{"observed_at":"2026-08-16T00:54:39.382829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09990","last_updated":"2024-04-15T17:59:31Z","snapshot_observed_at":"2026-08-16T14:00:43.952995Z","submitted_at":"2024-04-15T17:59:31Z","title":"HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09990","snapshot_observed_at":"2026-08-16T00:54:39.386856Z","title":"Learning disentangled identifiers for action-customized text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.386856Z"},"links":{"cited_paper":"/paper/2404.09990","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:fd686133e109b27541a481d7c29d634d6f945cc8448a2858cd1d578744ba2420","observation_id":"3783a247-026f-40ca-a6a6-e76974f787d6","resolution":{"observed_at":"2026-08-16T00:54:39.386856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08545","last_updated":"2024-11-13T11:46:42Z","snapshot_observed_at":"2026-08-17T10:56:42.869526Z","submitted_at":"2024-11-13T11:46:42Z","title":"APDDv2: Aesthetics of Paintings and Drawings Dataset with Artist Labeled Scores and Comments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08545","snapshot_observed_at":"2026-08-16T00:54:39.390569Z","title":"Apddv2: Aesthetics of paintings and drawings dataset with artist labeled scores and comments, 2024.https://arxiv.org/abs/2411.08545","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.390569Z"},"links":{"cited_paper":"/paper/2411.08545","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:a5cc8e05ec5ee4e2fce1ba7f287aeb2dc4d3e736d4c02b2012ea3a20d535aabf","observation_id":"3d0d48ce-b37c-4479-a35c-2be81d045ce3","resolution":{"observed_at":"2026-08-16T00:54:39.390569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-14T09:16:47.522119Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-16T00:54:39.398242Z","title":"World model on million-length video and language with ringattention.arXiv preprint arXiv:2402.08268,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.398242Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:2cc3408793fb5d97ce7b7aa89d90a40174a78895af5842098ae80e9c3ac44bed","observation_id":"d2c84bee-5d3b-4931-96f1-c985434db4a2","resolution":{"observed_at":"2026-08-16T00:54:39.398242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-16T00:54:39.402535Z","title":"Deepseek-vl: towards real-world vision-language understanding.arXiv preprint arXiv:2403.05525, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.402535Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:9051a1f83da2497ddf75bd1160b8bf4bb21114db307c0651e693ea0ab3cef3d6","observation_id":"89e965eb-6794-4c49-952e-45cfd293c232","resolution":{"observed_at":"2026-08-16T00:54:39.402535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-14T06:07:59.988146Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-16T00:54:39.410598Z","title":"Transfer between modalities with metaqueries.arXiv preprint arXiv:2504.06256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.410598Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:541b2f3e400004d93ca38e2bca0c4c8c839aa34646b7b2e89e7b15221021cc07","observation_id":"17b340fb-0238-4536-bead-72e5e8a9270e","resolution":{"observed_at":"2026-08-16T00:54:39.410598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-16T00:54:39.414818Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.414818Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:40dcbe6d0b50451cd7ea45ed03a62102735e0342d52ffe8b0fe1d9187d1ffa44","observation_id":"2893fd7a-b9fe-41ea-a130-0dff8427c7da","resolution":{"observed_at":"2026-08-16T00:54:39.414818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-08-15T18:07:41.591747Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-16T00:54:39.419665Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation.arXiv preprint arXiv:2412.03069,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.419665Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:bd8392327d6e266e37589786c83f3d35c9386ec0864911793bd3f70fdd10ce0f","observation_id":"7807693a-b4d5-4c74-8b19-ebf9a6b6560e","resolution":{"observed_at":"2026-08-16T00:54:39.419665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-16T00:54:39.423687Z","title":"Hierarchical text-conditional image generation with clip latents.arXiv preprint arXiv:2204.06125, 1(2):3,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.423687Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:b3629082f7d37fbaf49421baa72f38a704278dfc5a13301443fef343adb31fd7","observation_id":"71722832-4a1f-4ecd-87f9-8e504e464315","resolution":{"observed_at":"2026-08-16T00:54:39.423687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-08-13T17:36:16.794649Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08402","snapshot_observed_at":"2026-08-16T00:54:39.427677Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.arXiv preprint arXiv:2210.08402,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.427677Z"},"links":{"cited_paper":"/paper/2210.08402","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:a07c9aa228e4e0a34b25524743be6b44004bdfeca0ce7b279deb64935869b72d","observation_id":"56fd9f63-719c-4e28-8991-baa5cce05475","resolution":{"observed_at":"2026-08-16T00:54:39.427677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15110","last_updated":"2023-10-23T17:18:59Z","snapshot_observed_at":"2026-08-15T06:11:26.743203Z","submitted_at":"2023-10-23T17:18:59Z","title":"Zero123++: a Single Image to Consistent Multi-view Diffusion Base Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15110","snapshot_observed_at":"2026-08-16T00:54:39.431895Z","title":"Zero123++: a single image to consistent multi-view diffusion base model.arXiv preprint arXiv:2310.15110,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.431895Z"},"links":{"cited_paper":"/paper/2310.15110","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:f6112c104802f850c15a5de20534eacec4df54bfe550a441508c1dc1e771c06d","observation_id":"da24f654-9566-4786-9bf4-9e6241e068e8","resolution":{"observed_at":"2026-08-16T00:54:39.431895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-18T01:52:10.329183Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05848","snapshot_observed_at":"2026-08-16T00:54:39.436189Z","title":"Motionstone: Decoupled motion intensity modulation with diffusion transformer for image-to-video generation.arXiv preprint arXiv:2412.05848,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.436189Z"},"links":{"cited_paper":"/paper/2412.05848","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:3bbcd16343c9602261923c5ba6dabb1758466959d789afe2ea390cc0e979c309","observation_id":"bbdba283-8a8a-49f4-b5da-b8002ae839ee","resolution":{"observed_at":"2026-08-16T00:54:39.436189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-16T00:54:39.440165Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.440165Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:527c0d7508397283b089096431762d1cd53533049f8e11218b8eb29cdffb9c7c","observation_id":"78ac85fd-34de-411d-abc6-4a0c4992d7f1","resolution":{"observed_at":"2026-08-16T00:54:39.440165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-16T03:54:00.453682Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03085","snapshot_observed_at":"2026-08-16T00:54:39.444113Z","title":"Mimir: Improving video diffusion models for precise text understanding.arXiv preprint arXiv:2412.03085, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.444113Z"},"links":{"cited_paper":"/paper/2412.03085","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:8e3c460eca2c7cb4265adac6e7660d3adc8f09943652ca46a1e67e289ce29632","observation_id":"91f99a5d-9e87-4f77-a016-a2290ebe8cf9","resolution":{"observed_at":"2026-08-16T00:54:39.444113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-17T07:24:03.168446Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-16T00:54:39.448090Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning.arXiv preprint arXiv:2412.14164,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.448090Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:e99ce88b4922bbf0874f97ce58a489aa5b0288c04d162eca4503ed5d4bbb371f","observation_id":"61a90960-d04a-4851-8c9f-856137272d77","resolution":{"observed_at":"2026-08-16T00:54:39.448090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T00:54:39.451901Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.451901Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:04841eb5b207dafa224d42ff3a0f15478fff91657d847a775454782169ffed9d","observation_id":"af5fc222-a721-4883-9c87-ee16ee419e9a","resolution":{"observed_at":"2026-08-16T00:54:39.451901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-16T00:54:39.455447Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.455447Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:220f8b22f076cba64d3304fb53c5c17099385d27f1f2a41f2a8b0490b94b072b","observation_id":"4d1146fc-0eb1-41a4-b74e-042381a4c683","resolution":{"observed_at":"2026-08-16T00:54:39.455447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:39.406816Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.406816Z"},"links":{"citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:1fe762213188b58fe325e5cef2339c02d6c5116c6444a41714b0f0fde61d183e","observation_id":"01f1ccd5-7cc0-4823-9cdd-24de2661b94e","resolution":{"observed_at":"2026-08-16T00:54:39.406816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:39.394650Z","title":"Generating multi-image synthetic data for text-to-image customization.arXiv preprint arXiv:2502.01720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.394650Z"},"links":{"citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:2e75648023f23d076125061bcae0225a3d9a47e2ce4b7c9337353979934afe72","observation_id":"130c7eb8-3049-4825-beb9-2e02233d7881","resolution":{"observed_at":"2026-08-16T00:54:39.394650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-16T00:54:39.348620Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.348620Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:8884edff001d86e4141dd28bc9ec7e11ede7ed1e804b941171f0ee3f6eccf632","observation_id":"26d3c237-a09b-4881-9bc4-ea3a0df2eb69","resolution":{"observed_at":"2026-08-16T00:54:39.348620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-16T00:54:39.343788Z","title":"Qwen2.5-vl technical report, 2025.https://arxiv.org/abs/2502.13923","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.343788Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:a7c79be5556e6761cc7c0fc2fd89c40b01e5c2859165185e30a6aaf7bdd32ad6","observation_id":"498b05c5-4d02-4a4a-845e-c4c833cdab80","resolution":{"observed_at":"2026-08-16T00:54:39.343788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-16T14:59:02.096945Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-16T00:54:39.361926Z","title":"Dreamllm: Synergistic multimodal comprehension and creation.arXiv preprint arXiv:2309.11499,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.361926Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:89b9873c34d8c11bb7f9a17095a96fb6d8156e3910699cd38aaede4449cf5bc5","observation_id":"9f2c394d-7362-4fdb-a4fa-1660d6926752","resolution":{"observed_at":"2026-08-16T00:54:39.361926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-16T00:54:39.357754Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:39.357754Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.02471"},"observation_digest":"sha256:9e8b297bd6dce8a4d5fc75d5e25f752f3a965588c449ec0d966567c0d770bf3d","observation_id":"32011972-6cec-4edc-83e8-5684e860a827","resolution":{"observed_at":"2026-08-16T00:54:39.357754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 5 inbound Pith citation observations for arXiv:2505.02471."}