{"as_of":"2026-08-12T21:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e401b9a21f92de93c93373748a6a2534dac4152c3632005dcdc4261591e21761","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:57:32.398916Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T07:56:34.034047Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T07:59:50.522621Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"cited_work":{"arxiv_id":"2602.06442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.06442","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatumm: Robust context tracking for conversational interleaved generation","venue":null,"work_id":"6c1fcebd-1fe2-4179-b518-3b6bcf72241f","year":2026},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2602.06442","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:ebde95c4abe6112ba53badbebbd052512de1f864e461949df2f49fd059ce25d5","observation_id":"38fdb81e-6299-4b00-bdb2-00d92e0fe034","resolution":{"observed_at":"2026-06-02T04:04:28.060339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"cited_work":{"arxiv_id":"2602.06442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.06442","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatumm: Robust context tracking for conversational interleaved generation","venue":null,"work_id":"6c1fcebd-1fe2-4179-b518-3b6bcf72241f","year":2026},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-04T16:01:22.114748Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T11:46:52.658984Z"},"links":{"cited_paper":"/paper/2602.06442","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:6d2ed41809bca4a372b9867272d92bfecc078f6cb2050121f843b5a0093122a4","observation_id":"0568b999-1e95-4f48-aee1-1049582a42c6","resolution":{"observed_at":"2026-06-02T04:04:28.060339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"cited_work":{"arxiv_id":"2602.06442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.06442","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatumm: Robust context tracking for conversational interleaved generation","venue":null,"work_id":"6c1fcebd-1fe2-4179-b518-3b6bcf72241f","year":2026},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-04T16:01:22.114748Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2602.06442","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:5f0c5738aa4d58f06ce354d75765aebd9e10ee25cb024e6137b77b0d520f85b0","observation_id":"02508724-e637-43cf-b990-f1efea13a798","resolution":{"observed_at":"2026-06-02T04:04:28.060339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.06442/citation-record","integrity":"/paper/2602.06442/integrity","json":"/paper/2602.06442/citation-record.json","paper":"/paper/2602.06442"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T03:57:30.811900Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:30.811900Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:c99a35a6d4287d417d179b7f02406cc83c7aa3e781a74a2f44816667d609f60a","observation_id":"2907d4be-e570-4d53-9ef7-a282d5ab61ae","resolution":{"observed_at":"2026-08-03T03:57:30.811900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-03T03:57:31.101636Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset.arXiv preprint arXiv:2505.09568, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.101636Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:6c0ea3a542e1610118944735f17f7b82f5efb1f4e55770cf3ed5229b7bd730fa","observation_id":"ef345832-07bb-482c-a011-3bf70c7ad677","resolution":{"observed_at":"2026-08-03T03:57:31.101636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-11T10:16:40.394612Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-03T03:57:31.225142Z","title":"Emerging properties in unified multimodal pretraining","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.225142Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:8b1394a8ec6861bec9deb9e1717486f9c9a167630c4999abdb5f1c226fa0d0ab","observation_id":"20f3229a-bad8-4d1f-be56-23be805287e4","resolution":{"observed_at":"2026-08-03T03:57:31.225142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-02T03:02:58.907220Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-08-03T03:57:31.361767Z","title":"Making llama see and draw with seed tokenizer.arXiv preprint arXiv:2310.01218,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.361767Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:300d4fe678b237e7be8dd88eb2f861d2bdecacc50af1fef65fc2c2692df137a9","observation_id":"05cd402b-5186-48e7-9b3e-bded583af4b3","resolution":{"observed_at":"2026-08-03T03:57:31.361767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T03:57:31.571665Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.571665Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:cc78966f4bd5e5b91d0be6f4d5911f44b8330993c81481a585dd02f32a9bd148","observation_id":"ef0865f9-b12b-490f-bff0-48fe7b014036","resolution":{"observed_at":"2026-08-03T03:57:31.571665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-03T03:57:31.603641Z","title":"Kimi k2: Open agentic intelligence.arXiv preprint arXiv:2507.20534, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.603641Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:4e220cb3e6d2b9153026ed92a248eb10f958ed22c0c7122df725392da5cf7333","observation_id":"7e475d0b-2024-49f8-83b7-f4f35ba4c980","resolution":{"observed_at":"2026-08-03T03:57:31.603641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05472","snapshot_observed_at":"2026-08-03T03:57:31.714604Z","title":"Mogao: An omni foundation model for interleaved multi-modal generation.arXiv preprint arXiv:2505.05472,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.714604Z"},"links":{"cited_paper":"/paper/2505.05472","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:d4d1f53b4e98a22321c4ccc95be85137e3eef8bc5d7317c9b1bd7858b4572e5f","observation_id":"150451ff-f20c-4385-8020-d5fd9b445ce3","resolution":{"observed_at":"2026-08-03T03:57:31.714604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-08-03T03:57:31.746659Z","title":"Uniworld: High-resolution semantic encoders for unified visual understanding and generation.arXiv preprint arXiv:2506.03147,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.746659Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:60462012ffc6a51a39b769f1c335546645dee16f82b462c24b14ba5cf391156e","observation_id":"360fbe7a-fbaa-41c4-917b-6ea53d0d5214","resolution":{"observed_at":"2026-08-03T03:57:31.746659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-03T03:57:31.778476Z","title":"Flow matching for generative modeling.arXiv preprint arXiv:2210.02747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.778476Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:73027e7ec1b350ce4ff7a48774833fd44ae9b49d9b1c6ea36fc6b971aab8e031","observation_id":"b310d75e-d630-4110-aadd-ba18a0631ed2","resolution":{"observed_at":"2026-08-03T03:57:31.778476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-03T03:57:31.903060Z","title":"Transfer between modalities with metaqueries.arXiv preprint arXiv:2504.06256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.903060Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:24ed6513426b2807e841e92729772ef8c70501e4954b46600fb6791261ae3647","observation_id":"e45b428e-7aef-49e4-8149-7bb639a84684","resolution":{"observed_at":"2026-08-03T03:57:31.903060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-03T03:57:31.963242Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.963242Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:9c094783200e296c9b4b73023faf03f7d7759c1262dbbb2eb3b57941c77e7359","observation_id":"6a850956-3c6d-40e9-9cd6-ff6b79593112","resolution":{"observed_at":"2026-08-03T03:57:31.963242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-03T03:57:32.004110Z","title":"Hierarchical text- conditional image generation with clip latents.arXiv preprint arXiv:2204.06125,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.004110Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:f3af5889d4f41fa1fbb1ab53ede509fcfbc46a2e890a8a2c669e83860e843c7b","observation_id":"abeb05d0-d4e9-48ea-8191-0be8fb91b434","resolution":{"observed_at":"2026-08-03T03:57:32.004110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-11T11:31:09.745295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-03T03:57:32.062558Z","title":"Lmfusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.062558Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:ed945479e0cc313907a1d40d1863a0444d8a074cb1c3524f65211c58ea80702d","observation_id":"8854c87b-93c1-45fc-926c-f848d8caded8","resolution":{"observed_at":"2026-08-03T03:57:32.062558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-03T03:57:32.091846Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.091846Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:f128d23aff0ea5c86542ea9042372eab88dccf5c61c986d7d96354d221f06403","observation_id":"70a2320a-4766-4f16-bc25-36940e3df089","resolution":{"observed_at":"2026-08-03T03:57:32.091846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-08T15:05:21.947334Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-03T03:57:32.139758Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning.arXiv preprint arXiv:2412.14164, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.139758Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:e2f9528131247d0f550ab7626b575413260be4f4117b9237a63231875a27170b","observation_id":"2c8263df-b1d4-4b31-b4ae-6c37c2b39d35","resolution":{"observed_at":"2026-08-03T03:57:32.139758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06673","last_updated":"2024-12-09T17:11:50Z","snapshot_observed_at":"2026-08-11T19:23:16.518889Z","submitted_at":"2024-12-09T17:11:50Z","title":"ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06673","snapshot_observed_at":"2026-08-03T03:57:32.187422Z","title":"Illume: Illuminating your llms to see, draw, and self-enhance.arXiv preprint arXiv:2412.06673, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.187422Z"},"links":{"cited_paper":"/paper/2412.06673","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:baa02e017a637fe7b0b7f012ec1a357802ab9d1efd20651aebcd4d6abdf38f96","observation_id":"2fe808b7-d894-4cdd-a37e-c15a761e98e2","resolution":{"observed_at":"2026-08-03T03:57:32.187422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-03T03:57:32.251379Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.251379Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:7e49a0c6f844af1f01c3eacb2e3d6a07b2bbe25599b5a5f016dcc83df1e7410d","observation_id":"db5753a8-095a-4b55-b1ee-ccbdbc7c3197","resolution":{"observed_at":"2026-08-03T03:57:32.251379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-03T03:57:32.281430Z","title":"Show-o: One single transformer to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.281430Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:14e106181bd472776ae4db94c5c770ef3320082bd62725bdd29ed7363c65907a","observation_id":"e2361bb0-b0ae-485e-8c1b-78343abbc5aa","resolution":{"observed_at":"2026-08-03T03:57:32.281430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17762","last_updated":"2025-07-28T09:54:49Z","snapshot_observed_at":"2026-08-12T12:30:34.903890Z","submitted_at":"2024-11-26T03:33:52Z","title":"MUSE-VL: Modeling Unified VLM through Semantic Discrete Encoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17762","snapshot_observed_at":"2026-08-03T03:57:32.313692Z","title":"Muse-vl: Modeling unified vlm through semantic discrete encoding.arXiv preprint arXiv:2411.17762, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.313692Z"},"links":{"cited_paper":"/paper/2411.17762","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:27d6afc910d1e3b633bbf152d399f9c5ca406131f1213654da5e0a979a9d93f9","observation_id":"f2053d36-e18c-4b43-9566-42a2ccfc4c53","resolution":{"observed_at":"2026-08-03T03:57:32.313692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-03T03:57:32.341809Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.341809Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:fbb87926b4da8fbcab1051a4289c0dda0f29e16740631f43db6a67bfe273875f","observation_id":"ca0abd6c-d774-40a8-b0ef-2d5656a2f60d","resolution":{"observed_at":"2026-08-03T03:57:32.341809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-05T05:27:10.277230Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-08-03T03:57:32.391604Z","title":"Mmada: Multimodal large diffusion language models.arXiv preprint arXiv:2505.15809,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.391604Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:962930ef44ac0f15680c8d062f7809d30fee6e251c4fc59e05af000aa66fb24a","observation_id":"3c3f005f-105c-4236-a0e2-1d02d5f23d12","resolution":{"observed_at":"2026-08-03T03:57:32.391604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-03T03:57:32.394391Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities.arXiv preprint arXiv:2308.02490,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.394391Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:f5129164dcf4c35e3d6474fc0cef1995be20df02025d45f84cd2a6bb6459f246","observation_id":"6eb90171-2c19-491d-a7a4-8f669af613f5","resolution":{"observed_at":"2026-08-03T03:57:32.394391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-03T03:57:32.396743Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel.arXiv preprint arXiv:2304.11277,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.396743Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:30153808c5795c26e5145c2ff397e3d192ca272c38da97a6aafce238abf3a658","observation_id":"be1acf60-4fa2-4e23-b65b-843ccb443109","resolution":{"observed_at":"2026-08-03T03:57:32.396743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-03T03:57:32.398916Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model.arXiv preprint arXiv:2408.11039,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.398916Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:d84119ec583bd0c4400aa5e9aa13b36cd84999c2b6cb60a2a570e1d7217f5ed0","observation_id":"83f8ce4c-3982-4480-99c2-50b04e0364fc","resolution":{"observed_at":"2026-08-03T03:57:32.398916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-03T03:57:31.841665Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.841665Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:5ae962e615425c8056372c3192579e907015d87f6018a904c6c910d3ac2b1948","observation_id":"68ba6f10-bb0e-4033-aa1f-93991c4745d0","resolution":{"observed_at":"2026-08-03T03:57:31.841665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-11T03:45:32.889856Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-03T03:57:31.810711Z","title":"World model on million-length video and language with blockwise ringattention.arXiv preprint arXiv:2402.08268, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.810711Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:7dcf91bcdda67ee047b7b64fae17a4bec79cfcf9680e549a61774167cd32dda4","observation_id":"98cecb5d-a55f-4bae-8366-16434ed774b6","resolution":{"observed_at":"2026-08-03T03:57:31.810711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-03T03:57:31.509265Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.509265Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:23c5f2ffd913eb6cbcc3f52ff6e78e10a2d4a73b4be55d5d4a24a7ca5957e38d","observation_id":"f47e244c-4af5-41cd-940d-71392046a618","resolution":{"observed_at":"2026-08-03T03:57:31.509265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-03T03:57:30.931086Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:30.931086Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:65533a4ba6f0de12bdc3869db087b2df4d383835daefd6b72ff481803db8e7c7","observation_id":"1dd2ceb7-962a-4614-94e6-c625e89e68c6","resolution":{"observed_at":"2026-08-03T03:57:30.931086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-07T22:11:51.327954Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-03T03:57:31.307713Z","title":"Dreamllm: Synergistic multimodal comprehension and creation.arXiv preprint arXiv:2309.11499,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:31.307713Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:51e083044eca36e8924cb259e061519170aa648bef8e3a68e6beae5ab1727b5d","observation_id":"71627a80-7ae3-4956-b9e9-a5e4cd7a5fb8","resolution":{"observed_at":"2026-08-03T03:57:31.307713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T20:50:12.933006Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 3 inbound Pith citation observations for arXiv:2602.06442."}