{"as_of":"2026-08-09T12:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:40fdd2ff900dda8946c4a8daff0d4176ae22b45de6b836ac6efabcdbfc33ba3f","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:24:46.543451Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:53:24.588515Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T15:34:48.324415Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06474","snapshot_observed_at":"2026-08-07T12:53:24.588515Z","title":"Unimod: Efficient unified multimodal transformers with mixture-of-depths.CoRR, abs/2502.06474, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-09T02:35:27.089432Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:24.588515Z"},"links":{"cited_paper":"/paper/2502.06474","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:0905b0942c0d92294bdc8cefc5bfcf095750d83a3c98b315d6b4de6f34226177","observation_id":"abbcd6f8-fb9e-4226-bd62-53b52b9d3f5c","resolution":{"observed_at":"2026-08-07T12:53:24.588515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"cited_work":{"arxiv_id":"2502.06474","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06474","snapshot_observed_at":"2026-06-30T15:34:48.324415Z","title":"Unimod: Efficient unified multimodal transformers with mixture-of-depths","venue":null,"work_id":"fd56f337-4352-446f-8752-c659d898e8ed","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T05:37:36.329835Z"},"links":{"cited_paper":"/paper/2502.06474","citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:5493b5ade155162013440051ea8c245e2b2679fbcd60ddd8ec0c6a27d0f7ea66","observation_id":"58fe0e7f-27ae-411e-a5af-684a1867b2ce","resolution":{"observed_at":"2026-05-13T05:42:21.515237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"cited_work":{"arxiv_id":"2502.06474","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06474","snapshot_observed_at":"2026-06-30T15:34:48.324415Z","title":"Unimod: Efficient unified multimodal transformers with mixture-of-depths","venue":null,"work_id":"fd56f337-4352-446f-8752-c659d898e8ed","year":2025},"citing_paper":{"arxiv_id":"2605.12309","last_updated":"2026-05-15T11:58:28Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:56:22Z","title":"G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T16:53:11.708868Z"},"links":{"cited_paper":"/paper/2502.06474","citing_paper":"/paper/2605.12309"},"observation_digest":"sha256:e08e54f2715a58b7fe9ec823333704fc3bce0443a82412edcbd4e199bd1d3878","observation_id":"26e843a3-6b1e-45bc-9c71-5c2a53ef71b9","resolution":{"observed_at":"2026-05-19T16:57:40.364921Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"cited_work":{"arxiv_id":"2502.06474","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06474","snapshot_observed_at":"2026-06-30T15:34:48.324415Z","title":"Unimod: Efficient unified multimodal transformers with mixture-of-depths","venue":null,"work_id":"fd56f337-4352-446f-8752-c659d898e8ed","year":2025},"citing_paper":{"arxiv_id":"2605.27431","last_updated":"2026-05-22T05:01:21Z","snapshot_observed_at":"2026-08-06T06:43:33.194889Z","submitted_at":"2026-05-22T05:01:21Z","title":"Tackling Multimodal Learning Challenges with Mixture-of-Expert: A Survey","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T15:26:44.904121Z"},"links":{"cited_paper":"/paper/2502.06474","citing_paper":"/paper/2605.27431"},"observation_digest":"sha256:466a91b6157cb2a3cd84bb02e3cb7123eacd5f463b15fd73b053f3b8b32af2dd","observation_id":"40948551-860f-41bc-9405-333c4030406e","resolution":{"observed_at":"2026-06-30T15:34:48.325959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06474/citation-record","integrity":"/paper/2502.06474/integrity","json":"/paper/2502.06474/citation-record.json","paper":"/paper/2502.06474"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-08T15:24:46.275978Z","title":"A., Awan, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.275978Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:acb0d1c2aefe646824ad2bc07a1be39f50e941e61e99be8cf40c8be54a3655b2","observation_id":"c63fb4c8-4bfb-409d-8c48-ec1120092cfc","resolution":{"observed_at":"2026-08-08T15:24:46.275978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-08T15:24:46.302202Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.302202Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:dc99c50868cf3e353fe33295c239f52287c182c0eecadc159d6acfcef6d19a55","observation_id":"0e33dca7-c4f7-4387-b784-8a74b2954b88","resolution":{"observed_at":"2026-08-08T15:24:46.302202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16710","last_updated":"2024-10-18T04:02:31Z","snapshot_observed_at":"2026-08-08T01:15:44.293937Z","submitted_at":"2024-04-25T16:20:23Z","title":"LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16710","snapshot_observed_at":"2026-08-08T15:24:46.318344Z","title":"Layer skip: Enabling early exit inference and self-speculative decoding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.318344Z"},"links":{"cited_paper":"/paper/2404.16710","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:e89d934031ea034fdbbd428149cdba42c87b783a1acbf0ed03168fec9cad1ffe","observation_id":"de9dc85a-f968-4cb6-b57d-8584dee79dc9","resolution":{"observed_at":"2026-08-08T15:24:46.318344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-08T15:24:46.328337Z","title":"Model tells you what to discard: Adaptive KV cache compression for llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.328337Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:8174fb74a4a67bf5c3f01ee4e5c3c48a95f908e06fb1141e4e1dcaf074a3f27d","observation_id":"825f9edd-76e2-419d-83ff-c7084422ff30","resolution":{"observed_at":"2026-08-08T15:24:46.328337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-08T15:24:46.344410Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.344410Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:5456cfcf00ca829e35855d8be91505d32f4ee937b13b08cf7e5a270e7c76df9d","observation_id":"a011c63a-f74a-4271-b87b-80e6fca01e69","resolution":{"observed_at":"2026-08-08T15:24:46.344410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-08T15:24:46.349114Z","title":"Videopoet: A large language model for zero- shot video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.349114Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:6e52e775c18731d4cf4e70c0d5b2680afbcca5fc5007c0fe422835261befa48d","observation_id":"7c51bf4c-266a-46f7-ae10-861425d6a9b8","resolution":{"observed_at":"2026-08-08T15:24:46.349114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00127","last_updated":"2025-04-16T10:04:24Z","snapshot_observed_at":"2026-07-06T19:59:11.046948Z","submitted_at":"2024-11-28T13:00:38Z","title":"Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific Heads","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00127","snapshot_observed_at":"2026-08-08T15:24:46.353838Z","title":"Orthus: Autoregressive interleaved image- text generation with modality-specific heads","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.353838Z"},"links":{"cited_paper":"/paper/2412.00127","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:5966112ae0ea69a55fa3a58bc04a3448809eaf6f6ffc2ae39ccf7986874d8c0c","observation_id":"26df7ed4-86df-468d-a80a-8949774e4c65","resolution":{"observed_at":"2026-08-08T15:24:46.353838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07975","last_updated":"2025-03-24T08:33:32Z","snapshot_observed_at":"2026-07-06T19:49:17.129421Z","submitted_at":"2024-11-12T17:55:10Z","title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07975","snapshot_observed_at":"2026-08-08T15:24:46.363865Z","title":"Janusflow: Har- monizing autoregression and rectified flow for unified multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.363865Z"},"links":{"cited_paper":"/paper/2411.07975","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:d26c585e9a0b360ab5eec4e08e273e5fb2bac1051a0bf991622837b7adb6110c","observation_id":"cdd7047f-2df8-4500-8677-8ba2db133a57","resolution":{"observed_at":"2026-08-08T15:24:46.363865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-08T15:24:46.368796Z","title":"Mm1: Methods, analysis & insights from multimodal llm pre-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.368796Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:3825cba1bb60e28be0b13da784a8a392d96cb3ebf9d2b1fa04678710c2ebbb31","observation_id":"095f80cc-32f8-479a-a231-78baef1b8778","resolution":{"observed_at":"2026-08-08T15:24:46.368796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-08T15:24:46.373451Z","title":"github.io/book2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.373451Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:8f0e9c8b23fb6157c9a575499d6cd427866a331b349717ab1841e07f067e8b99","observation_id":"4c1aa551-d1e4-4f0c-8e63-5844c4dd034d","resolution":{"observed_at":"2026-08-08T15:24:46.373451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-08T15:24:46.377880Z","title":"Kosmos-2: Grounding multimodal large language models to the world","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.377880Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:0d9a8e6180276dba3285fc2524b4faef777d88b33989f573e7fe4a0e23bd1465","observation_id":"bde2103b-7a1e-4b64-a249-5eb81122764f","resolution":{"observed_at":"2026-08-08T15:24:46.377880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-08T15:24:46.382581Z","title":"Sdxl: Im- proving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.382581Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:5ac86fdb1cf4f251e7af5fb5f85b6cd65e6857efad68cd20cafec8cc523a4fa2","observation_id":"53951b5c-6db3-46ca-b28d-b82e8bb92df1","resolution":{"observed_at":"2026-08-08T15:24:46.382581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-07-06T20:01:23.373458Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-08T15:24:46.387548Z","title":"K., Yuan, Z., and Wu, X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.387548Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:427ca5ddfef135268f6492eed53ea397945e5ace55be2078f2924d7b60824568","observation_id":"88e622de-3e0f-4eca-bf68-b219530fdf91","resolution":{"observed_at":"2026-08-08T15:24:46.387548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:24:47.350273Z","title":null,"venue":null,"work_id":"2cc689ee-4027-48dd-b810-02dffacb201f","year":2025},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.392401Z"},"links":{"citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:c8c3a08b8bf14385f9172a49b42d78291f3887960c42a143fc5b90259f87f5e7","observation_id":"cc2ca83d-6672-4de8-bb7f-ca53b3d44a5e","resolution":{"observed_at":"2026-08-08T15:24:47.354874Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-08T15:24:46.397246Z","title":"Hierarchical text-conditional image generation with CLIP latents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.397246Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:c7ac459de7741f9e6b2a1a15d7cbfb9e6eb14bcdd3d02880c69418e98804c4ba","observation_id":"c4c028e0-6882-4d48-9cac-46a3517af7cf","resolution":{"observed_at":"2026-08-08T15:24:46.397246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12444","last_updated":"2025-03-21T15:52:39Z","snapshot_observed_at":"2026-07-06T20:08:12.033767Z","submitted_at":"2024-12-17T01:12:35Z","title":"LazyDiT: Lazy Learning for the Acceleration of Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12444","snapshot_observed_at":"2026-08-08T15:24:46.402324Z","title":"Lazydit: Lazy learning for the acceleration of diffusion transform- ers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.402324Z"},"links":{"cited_paper":"/paper/2412.12444","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:94002dbe897067d57a9e5d7eff2d9e5e28aee61db1ca867a30e299eb44cbd451","observation_id":"cf6657fd-d1cd-4d8e-948c-c77115c146c1","resolution":{"observed_at":"2026-08-08T15:24:46.402324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-08T15:24:46.407707Z","title":"V ., Zettle- moyer, L., and Yu, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.407707Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:268b95c6b8720430815ad5509087c194219fa70d4af9101a627e644cc9edb8ae","observation_id":"4281b462-436e-40f7-899c-6eae8f1ce502","resolution":{"observed_at":"2026-08-08T15:24:46.407707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-08T15:24:46.412515Z","title":"Journeydb: A benchmark for generative image understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.412515Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:dfe9824c9f6588959c05ac6c832e283cb1bbefeafde47a11ce7cd0c881d9721f","observation_id":"b473c12a-d2f8-4217-8a33-c9525174e64f","resolution":{"observed_at":"2026-08-08T15:24:46.412515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-08T15:24:46.417390Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.417390Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:c912432a39d34662204b39d81c2633ea251c253fd550e2a342d0c7299e7c49da","observation_id":"110289f0-5ca2-4927-8b8a-e23636be0980","resolution":{"observed_at":"2026-08-08T15:24:46.417390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-08T15:24:46.421942Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.421942Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:5d9f95eb8f3d3e3ba73c06b38f93704a7d2cc8b6e27f3a51603ff46780fa21df","observation_id":"79059f33-c100-4d1b-b7b4-d571d6ca9bec","resolution":{"observed_at":"2026-08-08T15:24:46.421942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-08T15:24:46.426860Z","title":"C., Yang, J., Yang, S., Iyer, A., Pan, X., Wang, A., Fergus, R., LeCun, Y ., and Xie, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.426860Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:58fc7f1dd21897db07c71b262b9a6472ad208805ccd5a991e1706161af2b8f4e","observation_id":"c148cd9b-4ffb-49af-bc49-4b66fc93056e","resolution":{"observed_at":"2026-08-08T15:24:46.426860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-08T15:24:46.436695Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.436695Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:b7d0e37ae70f4e30fb58c5279df27a3c2d8c80816ac656c37ced91a98e9692a6","observation_id":"1df2559a-1339-48ff-be7d-6d756590c2fb","resolution":{"observed_at":"2026-08-08T15:24:46.436695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14322","last_updated":"2023-10-16T18:43:25Z","snapshot_observed_at":"2026-07-06T16:23:26.584450Z","submitted_at":"2023-09-25T17:48:51Z","title":"Small-scale proxies for large-scale Transformer training instabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14322","snapshot_observed_at":"2026-08-08T15:24:46.441487Z","title":"J., Xiao, L., Everett, K., Alemi, A., Adlam, B., Co-Reyes, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.441487Z"},"links":{"cited_paper":"/paper/2309.14322","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:cc8cd237f67388c350d2ef7a3fb516b7eb688e6a50525388a076b7a5e5bb1fdc","observation_id":"efd15f35-2117-4e19-8fed-ef327207ff6b","resolution":{"observed_at":"2026-08-08T15:24:46.441487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-08T15:24:46.446643Z","title":"Liquid: Language models are scalable multi-modal generators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.446643Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:3dd79ed23a183648a033e3a67aa4039dd6726a2970ca6a9397cdf00bacd5e4a1","observation_id":"8dd074de-e5b9-4644-b9b5-bd5ae90f6f6a","resolution":{"observed_at":"2026-08-08T15:24:46.446643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-08T15:24:46.451544Z","title":"J., Wang, W., Lin, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.451544Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:50837793d1ea7fac6212387dac3b7ba75e3dd8507702dc7aaf078ecc5225ca77","observation_id":"fbf77a66-4013-4097-8e57-66abf718d4dc","resolution":{"observed_at":"2026-08-08T15:24:46.451544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08683","last_updated":"2024-10-11T08:39:28Z","snapshot_observed_at":"2026-08-07T03:46:04.809939Z","submitted_at":"2024-07-11T17:21:03Z","title":"SEED-Story: Multimodal Long Story Generation with Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08683","snapshot_observed_at":"2026-08-08T15:24:46.456245Z","title":"Openmoe: An early effort on open mixture- of-experts language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.456245Z"},"links":{"cited_paper":"/paper/2407.08683","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:28940d566913b57d44ff510892922bc9352a1466f62b59badfd07012bfd81d77","observation_id":"b003c0d9-950a-40cd-b724-cc0b7cff4dba","resolution":{"observed_at":"2026-08-08T15:24:46.456245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19335","last_updated":"2024-05-29T17:59:58Z","snapshot_observed_at":"2026-08-01T16:34:38.923197Z","submitted_at":"2024-05-29T17:59:58Z","title":"X-VILA: Cross-Modality Alignment for Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19335","snapshot_observed_at":"2026-08-08T15:24:46.461321Z","title":"X- vila: Cross-modality alignment for large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.461321Z"},"links":{"cited_paper":"/paper/2405.19335","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:92e114eb09d155a48e5e8b0544179d0a150472da8ef9427051696beb835149b0","observation_id":"e1bfa684-4684-409b-bf2e-c390f353b7fb","resolution":{"observed_at":"2026-08-08T15:24:46.461321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-08T15:24:46.475345Z","title":"Y ., Luong, T., Baid, G., Wang, Z., Va- sudevan, V ., Ku, A., Yang, Y ., Ayan, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.475345Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:957d1ed3979dd7666ea725496e073b18b83c7eb233c617d2dce03c4160e43841","observation_id":"eee958a3-ce80-4dc1-aa91-877675b86481","resolution":{"observed_at":"2026-08-08T15:24:46.475345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-08T15:24:46.486047Z","title":"B., Versari, L., Sohn, K., Minnen, D., Cheng, Y ., Gupta, A., Gu, X., Haupt- mann, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.486047Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:7ec792ad6fb5b75910fa484dc00cb95ed91667e9fd04b7f308162c402359eee5","observation_id":"6504452a-31dd-4d1c-927c-df0c3bfc2c1d","resolution":{"observed_at":"2026-08-08T15:24:46.486047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15436","last_updated":"2023-11-26T21:45:53Z","snapshot_observed_at":"2026-07-06T16:52:49.773956Z","submitted_at":"2023-11-26T21:45:53Z","title":"Learning to Skip for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15436","snapshot_observed_at":"2026-08-08T15:24:46.499373Z","title":"Learning to skip for language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.499373Z"},"links":{"cited_paper":"/paper/2311.15436","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:714ffc1d993c289d0069c4955cd41725c6e49f206baeb7f08f40f59ec8626375","observation_id":"7bfe05f8-b076-4a0c-9394-a1f47bbda071","resolution":{"observed_at":"2026-08-08T15:24:46.499373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04449","last_updated":"2025-08-06T16:57:39Z","snapshot_observed_at":"2026-08-09T02:48:17.286350Z","submitted_at":"2024-12-05T18:58:03Z","title":"p-MoD: Building Mixture-of-Depths MLLMs via Progressive Ratio Decay","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04449","snapshot_observed_at":"2026-08-08T15:24:46.513648Z","title":"p-mod: Building mixture-of-depths mllms via progres- sive ratio decay","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.513648Z"},"links":{"cited_paper":"/paper/2412.04449","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:987d10eb2613ba1467937d5074d2b53b9bb53f2449f33165c6cd8142efcc510a","observation_id":"3e54c091-40f9-4a1f-8be6-6f7de5e88539","resolution":{"observed_at":"2026-08-08T15:24:46.513648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-08T15:24:46.528792Z","title":"Minigpt-4: Enhancing vision-language understand- ing with advanced large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.528792Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:65078b89caaf0283df3c46ca2b16b7e4a5123e4430429d2e3d96641281d4b0a0","observation_id":"900c9ef1-c8e9-4ba2-b157-c3db2f84643b","resolution":{"observed_at":"2026-08-08T15:24:46.528792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:24:47.333447Z","title":null,"venue":null,"work_id":"640eadd9-a2c8-4315-9b40-c10637e09a81","year":2025},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.543451Z"},"links":{"citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:bf07a8277ae571ea39e96317d5e788ff6ac4cef5d1e0fd51e6da0900bcff133d","observation_id":"a46aff11-8af8-4309-a0b6-a77bf14fa7e3","resolution":{"observed_at":"2026-08-08T15:24:47.339079Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","snapshot_observed_at":"2026-08-05T15:59:28.924210Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09604","snapshot_observed_at":"2026-08-08T15:24:46.358407Z","title":"LastName, F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":324,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.358407Z"},"links":{"cited_paper":"/paper/2412.09604","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:74482d98d3cbb1e7c65d0d925cf677ecc3a0e7563f9e7dfdb7f8f5db21fcb23d","observation_id":"0bec555d-1264-4718-b863-d5dba6560ffc","resolution":{"observed_at":"2026-08-08T15:24:46.358407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-08T15:24:46.281260Z","title":"M., Hauth, A., Millican, K., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.281260Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:952a8f6e3ed4212f22272d25d46323a62b2967f82d0b18bf327cb815c636f169","observation_id":"8af2fb02-5c1d-4d85-849f-6d1225605dad","resolution":{"observed_at":"2026-08-08T15:24:46.281260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-08T15:24:46.334262Z","title":"and Salimans, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.334262Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:a4495787bf88521e08710bcfd7a5f628141cb1c1179b8b4a89c574d7a658feea","observation_id":"05cdec10-e926-4ce6-8263-4117add83473","resolution":{"observed_at":"2026-08-08T15:24:46.334262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-07T22:11:51.327954Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-08T15:24:46.313275Z","title":"Dreamllm: Syn- ergistic multimodal comprehension and creation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.313275Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:7ba79b1b0a594e45fe6f4adbff923054ed5ec7506ce1e8e7283b7482a05eda95","observation_id":"482684df-b832-4f66-9fa5-b741493bf46f","resolution":{"observed_at":"2026-08-08T15:24:46.313275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-08T15:24:46.466171Z","title":"Y ., Zhang, H., Pang, R., Qin, J., Ku, A., Xu, Y ., Baldridge, J., and Wu, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.466171Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:1edd3a80cdcea19dc364eb1e3f6e736df7f499a66b0514e40f539b1c93b766e7","observation_id":"36281543-3e94-4460-ba97-80e8278b466f","resolution":{"observed_at":"2026-08-08T15:24:46.466171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04094","last_updated":"2019-04-09T18:01:28Z","snapshot_observed_at":"2026-08-06T22:51:14.869467Z","submitted_at":"2019-02-11T19:02:27Z","title":"BERT has a Mouth, and It Must Speak: BERT as a Markov Random Field Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.04094","snapshot_observed_at":"2026-08-08T15:24:46.431621Z","title":"N., Kaiser,Ł., and Polosukhin, I","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.431621Z"},"links":{"cited_paper":"/paper/1902.04094","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:dbb8b0028f1a248cea8c29a9a5d0450053885ee2b1d803f577e84120bcba100f","observation_id":"e6010ea1-63ee-4612-8273-cfa1f1b8418c","resolution":{"observed_at":"2026-08-08T15:24:46.431621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-08T15:24:46.339298Z","title":"Q., Sablayrolles, A., Roux, A., Mensch, A., Savary, B., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.339298Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:e14f19deddb56c98f91397560419090613f7882591afb4f3899f7eb09780dc47","observation_id":"7f680462-8a03-4afc-8fdf-40674abcd6c3","resolution":{"observed_at":"2026-08-08T15:24:46.339298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06204","last_updated":"2025-04-09T13:54:59Z","snapshot_observed_at":"2026-08-07T19:39:57.333135Z","submitted_at":"2024-06-26T16:34:33Z","title":"A Survey on Mixture of Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06204","snapshot_observed_at":"2026-08-08T15:24:46.292018Z","title":"A survey on mixture of experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.292018Z"},"links":{"cited_paper":"/paper/2407.06204","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:359c55c6927165d6eb297843c6847ccc70590e8a165eeec4744f2b984d93f83c","observation_id":"5af0c397-f79e-465e-be57-6da0bd3d65ed","resolution":{"observed_at":"2026-08-08T15:24:46.292018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-08T15:24:46.286665Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.286665Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:0f206d53b21168da5dde2f87c64209286dce6d7a5a4e8727fa788a928b8c7f61","observation_id":"683d76c9-e5f8-4aa1-a621-f85dc2845bbd","resolution":{"observed_at":"2026-08-08T15:24:46.286665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-08T15:24:46.297104Z","title":"T., Rubinstein, M., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.297104Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:03c1e0506b460ef8bfce74b1232ceba049cce57cadee233bc78adab57d60162a","observation_id":"e226a789-8427-4973-bcc9-0d1358c5bb95","resolution":{"observed_at":"2026-08-08T15:24:46.297104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02628","last_updated":"2023-07-05T19:59:09Z","snapshot_observed_at":"2026-07-06T15:50:49.116859Z","submitted_at":"2023-07-05T19:59:09Z","title":"SkipDecode: Autoregressive Skip Decoding with Batching and Caching for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02628","snapshot_observed_at":"2026-08-08T15:24:46.308313Z","title":"Skipdecode: Autoregressive skip decoding with batching and caching for efficient llm inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.308313Z"},"links":{"cited_paper":"/paper/2307.02628","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:59a8ece7b53fdef8e78386468af97743e4f515254fb231a40c78796c50899103","observation_id":"9ab3af2b-2f8d-4b4c-bcae-ff369ea093b4","resolution":{"observed_at":"2026-08-08T15:24:46.308313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-08T15:24:46.323219Z","title":"MME: A comprehensive evaluation benchmark for mul- timodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.323219Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:75b501e0cf292071b787475c828a0fab819ff8e6e1b229355512cf18b81c38f3","observation_id":"7d5f93f8-5a0e-40df-8127-edb02d113fb7","resolution":{"observed_at":"2026-08-08T15:24:46.323219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 4 inbound Pith citation observations for arXiv:2502.06474."}