{"as_of":"2026-08-10T09:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:56f33e07a95a3e59123eca6350dd0a917593f2bae401327b6d7cbc8c61365bb8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":46,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:20:02.915960Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-08T15:24:46.407707Z","title":"V ., Zettle- moyer, L., and Yu, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.407707Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:539acf9d1a99ab83d90fdae06f5df8d243b46101b9ba10f38b10dcdfbad58f6f","observation_id":"4281b462-436e-40f7-899c-6eae8f1ce502","resolution":{"observed_at":"2026-08-08T15:24:46.407707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-09T11:20:02.915960Z","title":"Singh, A., Natarajan, V ., Shah, M., Jiang, Y ., Chen, X., Batra, D., Parikh, D., and Rohrbach, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-09T19:21:05.316073Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.915960Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:026da7f09be4a08274d82bdffb202f49c6d2f2160d8edb599a4f6e0dc35ff08c","observation_id":"ee30dcd7-c7ae-46b0-88c6-2244f47e3098","resolution":{"observed_at":"2026-08-09T11:20:02.915960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-08T10:24:41.573614Z","title":"V ., Zettle- moyer, L., and Yu, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-09T19:20:46.499732Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T10:24:41.573614Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2502.10458"},"observation_digest":"sha256:d737a44cc3f3451172b8d2096bd89949f430ae232268c2f5fb09d7545f8973b5","observation_id":"82064ae3-1537-41f5-954b-ed80812f159e","resolution":{"observed_at":"2026-08-08T10:24:41.573614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T16:24:27.407376Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2503.07265"},"observation_digest":"sha256:bf075c5638b6ddf161f9b21eb9d0084b77e661e96e3842fbda588b42b44a8f89","observation_id":"df39cbdd-3381-441e-a123-c2e256285cdc","resolution":{"observed_at":"2026-05-15T16:24:27.719941Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T22:49:23.074271Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2504.06256"},"observation_digest":"sha256:df7501088b2b46dbe9613a4faf36d7201b0d4447e16bbca8068c948c951c33b4","observation_id":"b00e0bf0-cad8-4fb7-9243-39b51f257aa3","resolution":{"observed_at":"2026-05-14T22:49:23.256298Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T23:34:26.878354Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2505.09568"},"observation_digest":"sha256:cdccc2d778ff278278b0ded502e12f98f2047ede16c262efca4951f164211678","observation_id":"f1969a78-60b6-4416-b4b6-16c8b833dcbf","resolution":{"observed_at":"2026-05-11T23:34:27.059549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:41.854132Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2505.14683"},"observation_digest":"sha256:2459631f3761a2cb1b1bd575621c93373905d086bee4b4ae5af96f9e049be708","observation_id":"51b2df35-9b9c-4a5f-92ae-eaf04c263e21","resolution":{"observed_at":"2026-05-10T16:23:41.942313Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-07T12:53:25.463377Z","title":"Llamafusion: Adapting pretrained language models for multimodal generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-09T02:35:27.089432Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:25.463377Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:9d76fd9a723530beca8029053f4c467a0483e1d9bf985e69ed0b46054a0f4139","observation_id":"05dac12b-2ec1-4114-b49e-baa9bdda25cf","resolution":{"observed_at":"2026-08-07T12:53:25.463377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-07T12:44:17.119373Z","title":"Llamafusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T16:12:19.827629Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.119373Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:e8c0690697e3610373922227234021f08e8af1791388e72ba9b00b1bcef52d2f","observation_id":"4e7650c6-7a75-4f80-a7ee-22d476024b72","resolution":{"observed_at":"2026-08-07T12:44:17.119373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-07T12:45:23.846395Z","title":"Xi victoria lin, luke zettle- moyer, and lili yu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23705","last_updated":"2025-05-29T17:40:09Z","snapshot_observed_at":"2026-08-07T12:37:05.162590Z","submitted_at":"2025-05-29T17:40:09Z","title":"Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:23.846395Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2505.23705"},"observation_digest":"sha256:daae47ad6457004bbe3522a10841c34f2bddc80004b83c7640ac351087f51452","observation_id":"31f5f6e2-7a61-446a-af72-fef9c92bf846","resolution":{"observed_at":"2026-08-07T12:45:23.846395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-07T05:51:42.915375Z","title":"Llamafusion: Adapting pretrained language models for multimodal generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06952","last_updated":"2026-06-17T19:53:28Z","snapshot_observed_at":"2026-08-09T07:24:19.702501Z","submitted_at":"2025-06-08T00:15:32Z","title":"LaTtE-Flow: Layerwise Timestep-Expert Flow-based Transformer","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:42.915375Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2506.06952"},"observation_digest":"sha256:f842ef64cc169b3438ad89a26e294a99755600c2691689280f68e81e12206c35","observation_id":"a98f8182-ac5b-424c-b2ac-401da3970f5a","resolution":{"observed_at":"2026-08-07T05:51:42.915375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-07T05:26:02.245217Z","title":"Zettlemoyer, and Lili Yu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.245217Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:06089c029602a9d730128871c13f819c2af082543fe4521238bf39de4611f0bc","observation_id":"58e5e446-5684-49ed-a9fb-a57566674917","resolution":{"observed_at":"2026-08-07T05:26:02.245217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-07T05:26:16.360980Z","title":"Llamafusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08006","last_updated":"2025-06-09T17:59:52Z","snapshot_observed_at":"2026-08-10T00:13:37.718432Z","submitted_at":"2025-06-09T17:59:52Z","title":"Dreamland: Controllable World Creation with Simulator and Generative Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:16.360980Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2506.08006"},"observation_digest":"sha256:1e8611337ca3dbdb0d21eff55a00bb22336551a4828bac82c88b252f47af7996","observation_id":"4a9b2bc1-764f-4d42-96fb-7ae08c69dbe3","resolution":{"observed_at":"2026-08-07T05:26:16.360980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:da978193e346451e0ac59022016ac185774ad217248b9e8ca5d8d0fcadfc022f","observation_id":"73a3cffc-4bfb-4dea-88c1-15afa9fa889f","resolution":{"observed_at":"2026-05-12T18:51:15.590013Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:4a34ed894c9021f140ff0434ad6b781d62809724cc885b1b1c463a67527b6b09","observation_id":"301bff5f-135a-4629-bd06-220f1bcd1fea","resolution":{"observed_at":"2026-05-19T07:52:10.858881Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-06T22:34:16.184346Z","title":"10684–10695","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21276","last_updated":"2025-06-26T14:00:38Z","snapshot_observed_at":"2026-08-09T04:12:22.306035Z","submitted_at":"2025-06-26T14:00:38Z","title":"WordCon: Word-level Typography Control in Scene Text Rendering","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:16.184346Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2506.21276"},"observation_digest":"sha256:1a9f596d64f95b54a0b042cf28be39f6071c820e8b8b9db4bfe04cc91fd8ad82","observation_id":"cd09d3a2-d46b-49ef-be2a-5baa8f857fa3","resolution":{"observed_at":"2026-08-06T22:34:16.184346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-06T20:49:42.028479Z","title":"Llamafu- sion: Adapting pretrained language models for multimodal generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01756","last_updated":"2025-07-22T02:25:49Z","snapshot_observed_at":"2026-08-08T16:57:37.559490Z","submitted_at":"2025-07-02T14:33:52Z","title":"Rethinking Discrete Tokens: Treating Them as Conditions for Continuous Autoregressive Image Synthesis","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:49:42.028479Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2507.01756"},"observation_digest":"sha256:6871ae6fad0f89b18e3542cf863ef657d1e0064b37ad0975209f37efac9a6214","observation_id":"72d32ee3-09c9-486d-a573-65be95ab85cf","resolution":{"observed_at":"2026-08-06T20:49:42.028479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-06T20:46:25.122139Z","title":"Llamafusion: Adapting pretrained language models for multimodal generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01792","last_updated":"2025-07-02T15:16:59Z","snapshot_observed_at":"2026-08-08T19:57:19.375306Z","submitted_at":"2025-07-02T15:16:59Z","title":"FreeLoRA: Enabling Training-Free LoRA Fusion for Autoregressive Multi-Subject Personalization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:25.122139Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2507.01792"},"observation_digest":"sha256:cbe305207c57c377a8a1922f62acb6ef6591063f640c9b12f7e7fa75656dfb12","observation_id":"d2c473d0-10b9-4e03-938d-35c50e31c5ef","resolution":{"observed_at":"2026-08-06T20:46:25.122139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-06T12:10:08.289255Z","title":"Lmfusion: Adapting pretrained language models for multimodal generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22058","last_updated":"2025-07-29T17:59:04Z","snapshot_observed_at":"2026-08-06T15:57:37.748671Z","submitted_at":"2025-07-29T17:59:04Z","title":"X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T12:10:08.289255Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2507.22058"},"observation_digest":"sha256:ffc999f2173886b664709c6941e6ba4628a26b74ff3a5c7873441468d629b0ee","observation_id":"594a0dbc-5e29-48b0-89c5-62155ea44e51","resolution":{"observed_at":"2026-08-06T12:10:08.289255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T13:31:09.919265Z","title":"Lmfusion: Adapting pretrained language models for multimodal generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00576","last_updated":"2025-08-30T18:04:19Z","snapshot_observed_at":"2026-08-06T11:26:06.418969Z","submitted_at":"2025-08-30T18:04:19Z","title":"Galaxea Open-World Dataset and G0 Dual-System VLA Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T13:31:09.919265Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2509.00576"},"observation_digest":"sha256:a5b7e769a49718311caeacdbaa41c016553e600dfc1c77102a563887160cc405","observation_id":"b17a1063-74ee-4200-8211-e01266c29ff6","resolution":{"observed_at":"2026-08-05T13:31:09.919265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-04T22:55:44.950531Z","title":"Llamafusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-07T20:36:07.154043Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.950531Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:68126f18e14c9039408f3c26e3de5631e67262a8bf8669b6461240186d5911e4","observation_id":"93875204-2588-4310-b563-7bab02756f4c","resolution":{"observed_at":"2026-08-04T22:55:44.950531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-04T22:36:08.140951Z","title":"Lmfusion: Adapting pretrained language models for multimodal generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-04T22:36:03.033298Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-04T22:36:08.140951Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2509.07295"},"observation_digest":"sha256:73c71f90b104570ac4715132d444c6faee3d861944751c6f9d8a234d228fa9b0","observation_id":"b562f445-e176-474e-9c2d-9b13fbd5371d","resolution":{"observed_at":"2026-08-04T22:36:08.140951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-04T10:49:49.019944Z","title":"Lmfusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-07T16:29:46.498912Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:49.019944Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:1ed87561188816271ef40b92f048e25abb6cf7ab6b9782feac00ce666b7318ce","observation_id":"ef364fbd-f8fd-4b0c-bf37-103f5d74a52b","resolution":{"observed_at":"2026-08-04T10:49:49.019944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-04T09:54:26.449060Z","title":"Llamafusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.449060Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:cd327be81718401ce202c90f36fffcaed1ec4ea43490ff8e290ff2218767a26a","observation_id":"527a0908-9afd-40e7-91e4-9cdb4c2ca112","resolution":{"observed_at":"2026-08-04T09:54:26.449060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-03T15:36:51.177913Z","title":"Lmfusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.16483","last_updated":"2026-05-27T09:07:02Z","snapshot_observed_at":"2026-08-03T15:36:47.371078Z","submitted_at":"2025-12-18T12:51:19Z","title":"FasterVAR: Plug-and-Play Acceleration for Visual Autoregressive Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T15:36:51.177913Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2512.16483"},"observation_digest":"sha256:05bc8fdeddae6254209c365a17516ca4e45f62b6c21ed55c4ae617f5114cbfe8","observation_id":"70e91f46-7163-4878-a42c-6e83fdf87912","resolution":{"observed_at":"2026-08-03T15:36:51.177913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2601.21798","last_updated":"2026-05-15T11:47:00Z","snapshot_observed_at":"2026-08-02T04:56:07.337606Z","submitted_at":"2026-01-29T14:42:46Z","title":"CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-21T14:48:21.787919Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2601.21798"},"observation_digest":"sha256:314a1cc712616e6b442b441fa0f2ae49dd8d135093787a170bd7d598c1a46ae6","observation_id":"71837f0d-f365-4e9a-814e-146d94d08b85","resolution":{"observed_at":"2026-05-21T14:50:14.718128Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-03T03:57:32.062558Z","title":"Lmfusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.062558Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:e63b23c1d25d769c3fccd46804b779cae29ffbf3c7b89bc673fe98aca9e7dd51","observation_id":"8854c87b-93c1-45fc-926c-f848d8caded8","resolution":{"observed_at":"2026-08-03T03:57:32.062558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2602.12370","last_updated":"2026-04-16T20:43:03Z","snapshot_observed_at":"2026-08-02T07:45:27.779427Z","submitted_at":"2026-02-12T20:02:21Z","title":"LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T05:01:11.880003Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2602.12370"},"observation_digest":"sha256:df4b8be09f2c68a75a2bde741c9c99cbf5bad24253ed38dbb15d6573237f3b86","observation_id":"c89b769c-3ee7-42e6-8247-0d57e1dcebd4","resolution":{"observed_at":"2026-05-16T05:02:19.618705Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-07-13T23:27:11.006580Z","title":"arXiv preprint arXiv:2412.15188 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T23:27:11.006580Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:ca509eab19f5d5428169f3220efd72d4a25234b5ff55fa8bc67b450161942e1d","observation_id":"aa3453fd-dc74-4795-95b3-f947d0d1f384","resolution":{"observed_at":"2026-07-13T23:27:11.006580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-03T02:33:57.876583Z","title":"arXiv preprint arXiv:2412.15188 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:57.876583Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:7dfcf194a09420e27c2c8caeb117f646a634246055b33de2f90b2742a4db83e7","observation_id":"8f54f030-7751-43f7-9d1a-645e1db41827","resolution":{"observed_at":"2026-08-03T02:33:57.876583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2604.08719","last_updated":"2026-04-09T19:13:14Z","snapshot_observed_at":"2026-07-06T22:57:45.084987Z","submitted_at":"2026-04-09T19:13:14Z","title":"LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T17:36:38.627415Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2604.08719"},"observation_digest":"sha256:3b9f260b1784fd23dab2b1c1d996ac29ff0f5f7aebeb959054af05995cc0a3a8","observation_id":"10617339-23d3-4317-89c2-12d670fc9617","resolution":{"observed_at":"2026-05-11T06:31:01.398245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2604.13540","last_updated":"2026-04-15T06:41:56Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T06:41:56Z","title":"Free Lunch for Unified Multimodal Models: Enhancing Generation via Reflective Rectification with Inherent Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T14:15:02.723774Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2604.13540"},"observation_digest":"sha256:1e14ad45dcb0bf743929cd7f9519bc2db15580390b95572e3ab189ed8a127b0c","observation_id":"b0800302-88df-4745-bf7b-dd720fc3f116","resolution":{"observed_at":"2026-05-10T14:15:28.953805Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2604.16552","last_updated":"2026-04-29T14:25:32Z","snapshot_observed_at":"2026-07-06T23:03:52.631613Z","submitted_at":"2026-04-17T07:28:04Z","title":"Co-generation of Layout and Shape from Text via Autoregressive 3D Diffusion","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T09:22:10.651922Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2604.16552"},"observation_digest":"sha256:2c1cb038b3c67158c4c2dd8193a5769f6677393b96b7e1ca686bd8f5d2fc8374","observation_id":"06ef9691-e5ef-45bd-8e01-14279bf16a8f","resolution":{"observed_at":"2026-05-10T09:23:37.044329Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2604.19902","last_updated":"2026-04-21T18:25:25Z","snapshot_observed_at":"2026-08-02T14:48:34.514966Z","submitted_at":"2026-04-21T18:25:25Z","title":"MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T03:27:50.144706Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2604.19902"},"observation_digest":"sha256:ff1babfb51c1d8a05f8619d638a8f39f593c0be6970f098755525b97fc68f973","observation_id":"c235ae80-05e8-4e10-8822-a65b8dec7d74","resolution":{"observed_at":"2026-05-10T03:29:21.669427Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:064f4e2f390d5ff0097ab1d6e0a7b5214c7e15bc9828bc2e0298bfe7b94c0015","observation_id":"66ee8cee-fdc4-41e5-ab3a-66281e56cb1d","resolution":{"observed_at":"2026-05-11T21:46:14.691378Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2604.26341","last_updated":"2026-04-29T06:46:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-29T06:46:59Z","title":"SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-07T13:45:53.346402Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2604.26341"},"observation_digest":"sha256:8eaeea71d1c6f46c720040136eedef1f6b97352db0d6f5eb6d2097c69cc0eeba","observation_id":"51bd0ddd-055f-465b-a524-64859693240b","resolution":{"observed_at":"2026-05-12T08:46:26.816740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2605.08029","last_updated":"2026-05-08T17:14:43Z","snapshot_observed_at":"2026-07-06T23:20:19.821342Z","submitted_at":"2026-05-08T17:14:43Z","title":"STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T02:44:59.644215Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2605.08029"},"observation_digest":"sha256:cd169c7f0c580cfdc0ae7fdcda1929012e142df821af63b1bcb39cbae841da90","observation_id":"73068788-af9b-4a9b-89b8-001858cd0320","resolution":{"observed_at":"2026-05-11T02:45:57.156891Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2605.15792","last_updated":"2026-05-15T09:48:46Z","snapshot_observed_at":"2026-08-08T03:23:41.035935Z","submitted_at":"2026-05-15T09:48:46Z","title":"Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T18:44:54.835575Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2605.15792"},"observation_digest":"sha256:e877eb56a15fa6ae521339b4fb44e60a869a27d7ff34490d21c89bf12f84a88e","observation_id":"c63185a6-3916-499f-8a62-05a744587d3b","resolution":{"observed_at":"2026-05-20T18:48:53.450985Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T11:32:24.007847Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:61be38110ab055b3e6f91755a3ade37149b89796ed3f26ace29b34e9d9ea2ce6","observation_id":"8fe1fa5e-1efa-4d0a-a3b9-8971c93eae2c","resolution":{"observed_at":"2026-05-20T11:33:14.202728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:a362be4683506a81e8b51436e0ff412b487d80df30edb078065b043f38cfd7f9","observation_id":"e554ff05-2944-404f-b193-242c8dc4740e","resolution":{"observed_at":"2026-06-30T18:35:00.282413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2606.00310","last_updated":"2026-05-29T19:34:39Z","snapshot_observed_at":"2026-08-02T19:03:39.307951Z","submitted_at":"2026-05-29T19:34:39Z","title":"Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T22:38:26.147074Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2606.00310"},"observation_digest":"sha256:46cae64b6393e0b8d3507551cc299ba546bb2809d99b8a3f8af4d55c418ace47","observation_id":"86284e46-aff6-4509-b9a9-68049f183b84","resolution":{"observed_at":"2026-06-28T22:42:46.709383Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2606.01858","last_updated":"2026-06-01T08:10:25Z","snapshot_observed_at":"2026-07-06T23:42:21.252086Z","submitted_at":"2026-06-01T08:10:25Z","title":"Polaris: Scaling Up Instruction-Guided Image Generation Towards Millions of Personalized Style Needs","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-06-28T15:07:03.439928Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2606.01858"},"observation_digest":"sha256:f090b671bf0cb6e468d9c0dc1a14d56feb0827e76b180e8c0f50e60989f2cb03","observation_id":"a6e04f3e-7839-49c8-b13a-3a891a308702","resolution":{"observed_at":"2026-07-01T22:46:18.726597Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2606.31451","last_updated":"2026-06-30T10:25:46Z","snapshot_observed_at":"2026-08-02T09:59:19.263812Z","submitted_at":"2026-06-30T10:25:46Z","title":"UniTac: A Unified Multimodal Model for Cross-Sensor Tactile Understanding and Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-01T05:56:03.597839Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2606.31451"},"observation_digest":"sha256:706b3bb897bb8c66a530b240de84ddad5640cd46833b4f0e1b35e5987e645810","observation_id":"74f42b3d-7ebf-4053-b30b-be90316c1160","resolution":{"observed_at":"2026-07-01T10:05:40.624385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-01T07:02:51.493005Z","title":"arXiv preprint arXiv:2412.15188 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21594","last_updated":"2026-07-23T17:59:58Z","snapshot_observed_at":"2026-08-07T01:32:12.278950Z","submitted_at":"2026-07-23T17:59:58Z","title":"Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers","version":1},"reference_index":126,"source":"arxiv_source","source_observed_at":"2026-08-01T07:02:51.493005Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2607.21594"},"observation_digest":"sha256:03777372bdedcdc4159f049a6f32bf49b5e82ecff70b8a1490a7c9e2ac359ae4","observation_id":"583ff840-3bba-428a-894e-007a3b67114d","resolution":{"observed_at":"2026-08-01T07:02:51.493005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-06T11:55:28.069606Z","title":"V., Zettlemoyer, L., and Yu, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T23:12:27.682802Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T11:55:28.069606Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:ef474a3c96efbb5dd781e08ba64a659d50164cad1cdebf191c3b78928a34bceb","observation_id":"9c8c05c8-dcfb-46f2-961d-2d9147766e61","resolution":{"observed_at":"2026-08-06T11:55:28.069606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-08T17:08:55.803846Z","title":"V., Zettlemoyer, L., and Yu, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T23:12:27.682802Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-08T17:08:55.803846Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:8d0e2b04248f5095d9dd9a5d3970c6443f8c588e9efa2e801f167f19a0deb32d","observation_id":"1b47279d-1775-4e41-80f8-d3ed0ac8850b","resolution":{"observed_at":"2026-08-08T17:08:55.803846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.15188/citation-record","integrity":"/paper/2412.15188/integrity","json":"/paper/2412.15188/citation-record.json","paper":"/paper/2412.15188"},"outbound":[],"paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T19:20:28.819295Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 46 inbound Pith citation observations for arXiv:2412.15188."}