{"as_of":"2026-08-09T22:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c20a55e110b1698bec34140f320932916f88fafe7d6f0fc089b8f0162431148d","coverage":[{"denominator":103,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T20:04:02.460265Z","state":"measured"},{"denominator":113,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":113,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:08:56.983795Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:28:55.819781Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05178","snapshot_observed_at":"2026-08-06T23:01:49.928203Z","title":"Qlip: Text-aligned visual tokenization unifies auto-regressive multimodal understanding and generation.arXiv preprint arXiv:2502.05178, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.928203Z"},"links":{"cited_paper":"/paper/2502.05178","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:6b5920c090597588598d0c4c92d72ddeeee9d6545b3d4d2c9599615870f40a9e","observation_id":"cf687e1a-b5f5-4563-a753-5427cbecb4a8","resolution":{"observed_at":"2026-08-06T23:01:49.928203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05178","snapshot_observed_at":"2026-08-06T21:52:26.204540Z","title":"QLIP: text-aligned visual tokenization unifies auto-regressive multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:26.204540Z"},"links":{"cited_paper":"/paper/2502.05178","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:3878e2867fe0ea76a1a9145ba1ba583dabcfdffdb3de451ec8912539a0874d0e","observation_id":"e389c8ad-e413-4311-96c6-dedb6e571120","resolution":{"observed_at":"2026-08-06T21:52:26.204540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2502.05178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05178","snapshot_observed_at":"2026-07-03T20:28:55.819781Z","title":"arXiv preprint arXiv:2502.05178 (2025) 2, 4, 7, 8 WinTok 15","venue":null,"work_id":"dc94ee65-ac1f-4c4d-a6f8-8c9f3bc865e7","year":2025},"citing_paper":{"arxiv_id":"2605.12500","last_updated":"2026-05-12T17:59:58Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:58Z","title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","version":1},"reference_index":167,"source":"pdf_text","source_observed_at":"2026-05-13T05:12:37.339084Z"},"links":{"cited_paper":"/paper/2502.05178","citing_paper":"/paper/2605.12500"},"observation_digest":"sha256:b55e44a5a4184054c3956c7d36cd7a1f121a003b2b52d98059b9260e24d05beb","observation_id":"78ce552d-ceb8-4c56-a03b-f1a590da903a","resolution":{"observed_at":"2026-05-13T05:17:18.666961Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2502.05178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05178","snapshot_observed_at":"2026-07-03T20:28:55.819781Z","title":"arXiv preprint arXiv:2502.05178 (2025) 2, 4, 7, 8 WinTok 15","venue":null,"work_id":"dc94ee65-ac1f-4c4d-a6f8-8c9f3bc865e7","year":2025},"citing_paper":{"arxiv_id":"2605.14028","last_updated":"2026-06-04T03:11:29Z","snapshot_observed_at":"2026-07-06T23:25:29.856145Z","submitted_at":"2026-05-13T18:38:51Z","title":"Unified Pix Token And Word Token Generative Language Model","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T21:30:45.355012Z"},"links":{"cited_paper":"/paper/2502.05178","citing_paper":"/paper/2605.14028"},"observation_digest":"sha256:2a9830387757e90660e720304de93f44a1abb1dfb2058f847ae1a9b9260e6af0","observation_id":"f6deb1b8-5c81-4bfc-b684-300bf9f9134d","resolution":{"observed_at":"2026-06-30T21:35:04.591361Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2502.05178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05178","snapshot_observed_at":"2026-07-03T20:28:55.819781Z","title":"arXiv preprint arXiv:2502.05178 (2025) 2, 4, 7, 8 WinTok 15","venue":null,"work_id":"dc94ee65-ac1f-4c4d-a6f8-8c9f3bc865e7","year":2025},"citing_paper":{"arxiv_id":"2605.18115","last_updated":"2026-05-18T09:24:39Z","snapshot_observed_at":"2026-08-06T04:43:08.432770Z","submitted_at":"2026-05-18T09:24:39Z","title":"WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-20T12:04:19.761430Z"},"links":{"cited_paper":"/paper/2502.05178","citing_paper":"/paper/2605.18115"},"observation_digest":"sha256:40374e3ac29194c4c837f8718b677b3c8e92880c7f92b534cd07c069c561fd6b","observation_id":"231eadc4-01d1-4ae1-ba6e-263234ac0b94","resolution":{"observed_at":"2026-05-20T12:08:15.768573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2502.05178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05178","snapshot_observed_at":"2026-07-03T20:28:55.819781Z","title":"arXiv preprint arXiv:2502.05178 (2025) 2, 4, 7, 8 WinTok 15","venue":null,"work_id":"dc94ee65-ac1f-4c4d-a6f8-8c9f3bc865e7","year":2025},"citing_paper":{"arxiv_id":"2606.03578","last_updated":"2026-06-02T12:47:14Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:47:14Z","title":"Diffusing in the Right Space: A Systematic Study of Latent Diffusability","version":1},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-06-28T10:44:24.318786Z"},"links":{"cited_paper":"/paper/2502.05178","citing_paper":"/paper/2606.03578"},"observation_digest":"sha256:8dbc7039a094ffdf1f8454647aa8c5c1e787e8b3c48e391dcd31adbd83bb4a06","observation_id":"0d553d7d-d8bb-4acb-bb92-f667a5f324c6","resolution":{"observed_at":"2026-07-02T02:36:27.631392Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2502.05178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05178","snapshot_observed_at":"2026-07-03T20:28:55.819781Z","title":"arXiv preprint arXiv:2502.05178 (2025) 2, 4, 7, 8 WinTok 15","venue":null,"work_id":"dc94ee65-ac1f-4c4d-a6f8-8c9f3bc865e7","year":2025},"citing_paper":{"arxiv_id":"2606.11363","last_updated":"2026-06-09T18:43:29Z","snapshot_observed_at":"2026-08-06T10:47:54.873857Z","submitted_at":"2026-06-09T18:43:29Z","title":"NSVQ: Mitigating Codebook Collapse by Stabilizing Encoder Drift in Vector Quantization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T13:18:47.472178Z"},"links":{"cited_paper":"/paper/2502.05178","citing_paper":"/paper/2606.11363"},"observation_digest":"sha256:7c310544f5cbaec4f2a75017b8b6185255d3b22e2f1308e1406b207229fbf6b9","observation_id":"b7cfaf30-7abf-4a31-8663-d096ee5faa72","resolution":{"observed_at":"2026-07-03T05:27:39.702114Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2502.05178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05178","snapshot_observed_at":"2026-07-03T20:28:55.819781Z","title":"arXiv preprint arXiv:2502.05178 (2025) 2, 4, 7, 8 WinTok 15","venue":null,"work_id":"dc94ee65-ac1f-4c4d-a6f8-8c9f3bc865e7","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2502.05178","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:82af023959d69be5757c8da7529338a9fcb2ca05c93a39d8ff2377c4bf416091","observation_id":"6d93c88c-7d14-4a5d-ae65-d42304fbf072","resolution":{"observed_at":"2026-07-03T14:38:28.819010Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2502.05178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05178","snapshot_observed_at":"2026-07-03T20:28:55.819781Z","title":"arXiv preprint arXiv:2502.05178 (2025) 2, 4, 7, 8 WinTok 15","venue":null,"work_id":"dc94ee65-ac1f-4c4d-a6f8-8c9f3bc865e7","year":2025},"citing_paper":{"arxiv_id":"2606.18249","last_updated":"2026-06-17T18:39:52Z","snapshot_observed_at":"2026-07-06T23:53:45.117607Z","submitted_at":"2026-06-16T17:59:22Z","title":"Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-27T01:18:03.846908Z"},"links":{"cited_paper":"/paper/2502.05178","citing_paper":"/paper/2606.18249"},"observation_digest":"sha256:21c9d923cbdfde20cf4a77248abe226ce1786a38e2ab86f6326ecf6136142807","observation_id":"3d54901a-9046-4a6d-9181-a448ae5835b3","resolution":{"observed_at":"2026-07-03T20:28:55.821216Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05178","snapshot_observed_at":"2026-08-01T05:45:53.491983Z","title":"Qlip: Text-aligned visual tokenization unifies auto-regressive multimodal understanding and generation.arXiv preprint arXiv:2502.05178, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-07T04:11:15.831910Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:53.491983Z"},"links":{"cited_paper":"/paper/2502.05178","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:d6006a0c8efe034fae5f3ed8c413c2ac0e649d9148075f5efc8784b1021d222d","observation_id":"aff2e8d0-fbac-4880-9063-09d70c87d728","resolution":{"observed_at":"2026-08-01T05:45:53.491983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05178","snapshot_observed_at":"2026-08-01T04:29:50.752053Z","title":"arXiv preprint arXiv:2502.05178 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22531","last_updated":"2026-07-24T17:59:39Z","snapshot_observed_at":"2026-08-07T13:04:18.211748Z","submitted_at":"2026-07-24T17:59:39Z","title":"Twins: Learn to Predict Unified Representations with Focal Loss","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-01T04:29:50.752053Z"},"links":{"cited_paper":"/paper/2502.05178","citing_paper":"/paper/2607.22531"},"observation_digest":"sha256:5e16df10dafba9dfd9c0850af5245784ce11704f038e6bf8a0b14352e47fcb0d","observation_id":"63171561-62da-4f9d-9d63-c7eec9039483","resolution":{"observed_at":"2026-08-01T04:29:50.752053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05178","snapshot_observed_at":"2026-08-06T11:55:28.219048Z","title":"Qlip: Text-aligned visual tokenization unifies auto-regressive multimodal understanding and generation.arXiv preprint arXiv:2502.05178, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T22:12:47.299665Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":1},"reference_index":157,"source":"pdf_text","source_observed_at":"2026-08-06T11:55:28.219048Z"},"links":{"cited_paper":"/paper/2502.05178","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:2648b29fa4dea19a4aeb0a37e06bffe52b2eb818d7fe694f7052dd90c151ec7f","observation_id":"dc275fa0-7300-4446-9dc3-cc9c0a1d4d35","resolution":{"observed_at":"2026-08-06T11:55:28.219048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05178","snapshot_observed_at":"2026-08-08T17:08:56.983795Z","title":"Qlip: Text-aligned visual tokenization unifies auto-regressive multimodal understanding and generation.arXiv preprint arXiv:2502.05178, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T22:12:47.299665Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":2},"reference_index":157,"source":"pdf_text","source_observed_at":"2026-08-08T17:08:56.983795Z"},"links":{"cited_paper":"/paper/2502.05178","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:9f4df54f67cd9cf2323874506fa4f70032d3e655d382da499121d4ac071d4422","observation_id":"59f237bf-22fe-4d5c-8e3e-c99693e2e1b9","resolution":{"observed_at":"2026-08-08T17:08:56.983795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.05178/citation-record","integrity":"/paper/2502.05178/integrity","json":"/paper/2502.05178/citation-record.json","paper":"/paper/2502.05178"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T20:04:02.010635Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.010635Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:06d8d61fb97a5632f4e812d85fd538b1f2be95456d78b014f34324638b235eda","observation_id":"8bd6c170-fe81-48bd-a650-84f219af87a7","resolution":{"observed_at":"2026-08-08T20:04:02.010635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.016595Z","title":"Soft-to-hard vector quantization for end-to-end learn- ing compressible representations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.016595Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:be55efd0cd02b5543fde9914260ae1fe2ca8ef638663e3617214eea83fe40a97","observation_id":"6a4c86db-f4e0-42f8-8f55-699fa5ff417e","resolution":{"observed_at":"2026-08-08T20:04:02.016595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.021553Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.021553Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:a321eabef39ecd696e289ae8f8ef4b8814df2de98f8f967d4b3326ab277d7fed","observation_id":"70005a9b-b630-48a4-b360-ed96d1e4ba27","resolution":{"observed_at":"2026-08-08T20:04:02.021553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.025789Z","title":"Fuyu-8b: A multimodal architecture for ai agents, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.025789Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:812e4872566d561adce28c8531a2023709ba9bb310c26640d1ba8a519e619700","observation_id":"a550fff0-826a-4228-8e97-170b988d81e5","resolution":{"observed_at":"2026-08-08T20:04:02.025789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-08T20:04:02.030015Z","title":"Estimating or propagating gradients through stochastic neurons for conditional computation","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.030015Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:f6a9c1fa63d328da2d4118d472a38adcff875c85b7fa972fbd3869ae5f8d4c9b","observation_id":"fd6f13ba-d675-417d-8964-02ab70d2b707","resolution":{"observed_at":"2026-08-08T20:04:02.030015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-08T20:04:02.035083Z","title":"Paligemma: A versatile 3b vlm for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.035083Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:bb270aafa1af5dada3e8e85a6046f6dcc3e2b5308ddcfba3a503732045a7868b","observation_id":"7d77e1e7-729b-43e5-a76e-dca36ec3a450","resolution":{"observed_at":"2026-08-08T20:04:02.035083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.040713Z","title":"Piqa: Reasoning about physical commonsense in nat- ural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.040713Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:4cdbd3a2ef93cfbb63d56564fd119a4c28f1717ce13f4e8f017d2358352b307c","observation_id":"b1754986-a731-4cee-8330-f1097faf8ba9","resolution":{"observed_at":"2026-08-08T20:04:02.040713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.045345Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.045345Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:6989cbd6aeeb6ded0a18359bd11faee876f609c5c35c1a8d4f0cd34774787f48","observation_id":"454e073c-559f-424a-9afa-6a2da8bf9107","resolution":{"observed_at":"2026-08-08T20:04:02.045345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.050027Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.050027Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:6d1a0089293e4c4ccf341d12bde9c2f71ddc137334ac024b02f97f01b7064fb1","observation_id":"2d31b2e6-2585-473e-bac5-f793d67e00a4","resolution":{"observed_at":"2026-08-08T20:04:02.050027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-08T09:03:25.135475Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-08T20:04:02.054853Z","title":"Training deep nets with sublinear memory cost","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.054853Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:3e51f3e888ff96cd600d590b5363078b13586eda0f7c54cc5ae33eef1cf449e4","observation_id":"cf430773-b946-4491-9606-1a949a34a93e","resolution":{"observed_at":"2026-08-08T20:04:02.054853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-08T20:04:02.059660Z","title":"Microsoft coco captions: Data collection and eval- uation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.059660Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:8a12eb928a1315202fb4c74ddc2727757b1c04a46fcf8301deb7deda40d4232a","observation_id":"2e71b303-585c-422d-aefa-e640109b3891","resolution":{"observed_at":"2026-08-08T20:04:02.059660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.063916Z","title":"Gradnorm: Gradient normalization for adaptive loss balancing in deep multitask networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.063916Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:dd11d77c5b81bd754fb4f0f1bdd0d5919db390b3bf6deb7ab678f6c1440a9a9a","observation_id":"9d0ea132-5568-4f63-817c-4766f2b741b3","resolution":{"observed_at":"2026-08-08T20:04:02.063916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.067982Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.067982Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:abc38ff094a0318d8dd591a53b07b6f062bc6b4d6ea070e4fa7807dd22f4a93c","observation_id":"a05f44f9-6282-4efa-863f-973f8f67adcc","resolution":{"observed_at":"2026-08-08T20:04:02.067982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.072545Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.072545Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:80214c904174d188cbec99b3e746dae7cc8ad01a304732e114b3616d918a1ad8","observation_id":"f59c9454-ea65-42bb-a951-49cd6d2377b2","resolution":{"observed_at":"2026-08-08T20:04:02.072545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.076761Z","title":"Scaling instruction- finetuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.076761Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:895fb7f5f62ebbe46c94333b6e274e7724ff8ef3cf6501c55464cae2eb4b9776","observation_id":"4298893b-9776-4bd9-9e09-8931c84393dc","resolution":{"observed_at":"2026-08-08T20:04:02.076761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-08T20:04:02.081513Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.081513Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:0e73003522a3f343b8c55aafe3ebac13f7d00c2f2d1d3ec7a2f04addc4eee795","observation_id":"303ad003-cea0-494f-ba3e-2810c68f09b8","resolution":{"observed_at":"2026-08-08T20:04:02.081513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.087307Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.087307Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:ebdd43586c51785216925a6f69d07efdd6e2d34b1879bf77e700c906cf35dbe4","observation_id":"ab67c416-a7ab-4037-99ad-b0399c4fac87","resolution":{"observed_at":"2026-08-08T20:04:02.087307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.091863Z","title":"Vision transformers need registers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.091863Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:0f1ba8379ee51ef15ebeaf26f966a75a61bf744aaf74a888bfa8768750f66d3d","observation_id":"68008d26-52c3-4387-8c0d-5669bcfcc032","resolution":{"observed_at":"2026-08-08T20:04:02.091863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.097385Z","title":"Scaling vision transformers to 22 billion pa- rameters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.097385Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:6e98d8d49c7ec9baa384aa6ef548808e17b63758a1e236322b0347d92f5b04d5","observation_id":"474d4554-538f-4321-886f-968502382f03","resolution":{"observed_at":"2026-08-08T20:04:02.097385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.101775Z","title":"Imagenet: A large-scale hierarchical im- age database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.101775Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:28b8a8e0184d142b32f38da90a90d0ac9591ab66f7d0d26bba101a9ab614930f","observation_id":"cf644a5d-2fe0-4b4f-abb8-bf8c8b01521f","resolution":{"observed_at":"2026-08-08T20:04:02.101775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.105628Z","title":"Unveiling encoder-free vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.105628Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:ca17dd10a5229bcb6f03f1e1a44b8226d8b270feb84d3310f8882e1fc120b621","observation_id":"aebfa514-5cbb-4c2f-99a4-f716ca22b36a","resolution":{"observed_at":"2026-08-08T20:04:02.105628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T20:04:02.109316Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.109316Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:4ccad4eced1cbb066b25f53df0cebf3e1450241fc2760e833dc69e57bde35255","observation_id":"fefafe59-b9a5-4b4a-995f-44bb4b20097e","resolution":{"observed_at":"2026-08-08T20:04:02.109316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.113967Z","title":"Scal- able pre-training of large autoregressive image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.113967Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:7d499d84b8198bcbcb0427568439b4e095e04b9705950ac6693f314af0b83293","observation_id":"e96fd0f2-3d88-4bb5-8d7f-860cde74123a","resolution":{"observed_at":"2026-08-08T20:04:02.113967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.118734Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.118734Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:b09faeb6feee9c5fc08364f2231da3570ff3a7fa40bbf1987417e9a34f67be5f","observation_id":"d5922cbe-cd1d-4439-8f5c-3877db231ce5","resolution":{"observed_at":"2026-08-08T20:04:02.118734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.123315Z","title":"Eva-02: A visual representa- tion for neon genesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.123315Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:c3bfe73880ce15f0e5efad1061168d7e8a1f5a4e90ded6d2e5b23c25fc59cfd9","observation_id":"e2648a11-c0fd-4ed2-9ba1-92e466db8701","resolution":{"observed_at":"2026-08-08T20:04:02.123315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-08T20:04:02.128254Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.128254Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:d8df533a9dee9320af01d2e9b9d39808e4c4fca37694fe8e9be6118d7feba4d2","observation_id":"8aae7597-f829-435a-8876-3f2c0b6a72e1","resolution":{"observed_at":"2026-08-08T20:04:02.128254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.132772Z","title":"Dat- acomp: In search of the next generation of multimodal datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.132772Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:d29e7957bb5ebfeaee8bf717cb32541c21a128160e9734968abaeda498bc7cc3","observation_id":"68643c2f-f220-4327-9c53-59953585761a","resolution":{"observed_at":"2026-08-08T20:04:02.132772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-08T20:04:02.136804Z","title":"Seed-x: Multimodal models with unified multi-granularity compre- hension and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.136804Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:0e3a0028bb9865c6e5efbbf381f4e55296e9098a69ec1bac8b6dbfbe71c8d282","observation_id":"ac7db086-f8f4-453a-a351-6da544f5c8b1","resolution":{"observed_at":"2026-08-08T20:04:02.136804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.141742Z","title":"Geneval: An object-focused framework for evaluating text- to-image alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.141742Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:74f4198be2680046b02939aa280b2907410832f28e74026347aa6ee29e7f2d5c","observation_id":"c849945b-773c-451c-b9e5-9512d611fba2","resolution":{"observed_at":"2026-08-08T20:04:02.141742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-08T20:04:02.146184Z","title":"Accurate, large minibatch sg d: training imagenet in 1 hour","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.146184Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:212b8b650ffc56ec01e9cbd0b627f9bccb35697f4ca25a68dbf35c47a5ce1fd1","observation_id":"b1d319c2-3025-4ddf-a27e-47606c75b218","resolution":{"observed_at":"2026-08-08T20:04:02.146184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.150055Z","title":"Making the v in vqa matter: El- evating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.150055Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:8dcd325d263d7ec1cfc20f8defa37e267159a989f0f937e7444276c4759b1e3d","observation_id":"c8701ceb-b64e-4d31-9c9a-1f3dea395f7e","resolution":{"observed_at":"2026-08-08T20:04:02.150055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.153789Z","title":"Noise-contrastive estimation: A new estimation principle for unnormalized statistical models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.153789Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:b12b5c8e03956b65f7f6a79b953087b75ebba9a1af337ffefc529d0539683a32","observation_id":"d270c97a-4c6c-4981-98bd-4a958a0aa107","resolution":{"observed_at":"2026-08-08T20:04:02.153789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.157535Z","title":"Masked autoencoders are scal- able vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.157535Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:8f3163bc3611f77e06a7c7a7e7921b1d45cfa696ad2ce990c009f0fbfca396ea","observation_id":"f9794115-36d8-4401-896c-bc4332b5b033","resolution":{"observed_at":"2026-08-08T20:04:02.157535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-08T20:04:02.162100Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.162100Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:464870bd7af9f6455ae04dc6dea89ecfec0d7361949ea8a40c65b6925851e7d7","observation_id":"69f1c8aa-6680-435a-b8b6-7313cc4c3e6c","resolution":{"observed_at":"2026-08-08T20:04:02.162100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.625675Z","title":"Gans trained by a two time-scale update rule converge to a local nash equi- librium","venue":null,"work_id":"db06c551-d477-4350-8657-ff021ffa7654","year":2017},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.166745Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:ff231b788107d47631126431d53111aa99671ebb519a03412fa295a3fb6239d6","observation_id":"2d757e65-fedb-44df-bad2-8b04f82e4657","resolution":{"observed_at":"2026-08-08T20:04:03.630265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-09T16:24:26.560430Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-08T20:04:02.171586Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.171586Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:34352bf747a9df17160aad801782b20d8c39c23d706a699f57287c002b8ac38c","observation_id":"734b2f13-c2ce-4f58-b9ff-f29389b70955","resolution":{"observed_at":"2026-08-08T20:04:02.171586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.611653Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"cc42b1e9-3fa0-403a-b095-3b2a5693e7a5","year":2019},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.176426Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:c4d2cd49c02741660ad92bc8ae8af0fbd312f02e3428e5662f50041d6d67d285","observation_id":"3492adc1-c3f7-4d19-9c2f-c4d58fa7e5fd","resolution":{"observed_at":"2026-08-08T20:04:03.616127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.597532Z","title":"Coincidence, categorization, and consolidation: Learning to recognize sounds with minimal supervision","venue":null,"work_id":"300d91c5-0ea5-423c-8141-4bf7590e96d3","year":null},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.180404Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:1cdf09192788b0abe205e700a7d50ff118727bc281e6c25b4b53bb2c38d86ad9","observation_id":"5f215137-e47e-4192-8f11-6eec88dd893b","resolution":{"observed_at":"2026-08-08T20:04:03.602250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.582780Z","title":"Unified language-vision pretraining with dy- namic discrete visual tokenization","venue":null,"work_id":"1235ac7a-1fd4-4321-8b7b-f9af8c772c5f","year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.185578Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:40c22d21f59a1ca0040f8811a8546608928bebaee940ddf8ea58ed1985a9a6f7","observation_id":"14eb0cb4-5d4f-4b17-94a7-bc8f0199e4a7","resolution":{"observed_at":"2026-08-08T20:04:03.587534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.568326Z","title":"Analyzing and improving the image quality of stylegan","venue":null,"work_id":"ab978185-25da-431a-bbda-78fb2ddf342d","year":2020},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.190018Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:e97d2cadb17dc14c66965976441992a7bd6a07535f4a0593aea6925362315570","observation_id":"79a1eb1c-072e-424c-90bb-900fcc3bbcb1","resolution":{"observed_at":"2026-08-08T20:04:03.573043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.552257Z","title":"Segment anything","venue":null,"work_id":"c3ef719f-baa2-454e-93e2-3e7dae4817c1","year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.194325Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:3bc7b496fa59b26ca11aebb8eea60dbbc6de09f13be63b04e3000a79d318e3b4","observation_id":"d6e18f26-832d-464c-9ee6-9e7bbca7cb06","resolution":{"observed_at":"2026-08-08T20:04:03.558335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.535844Z","title":"Sentencepiece: A sim- ple and language independent subword tokenizer and deto- kenizer for neural text processing","venue":null,"work_id":"ee441a62-81d6-4e2e-82b1-d9e6064f54e9","year":2018},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.198689Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:0e99037066d8b420512eacc8233f3f3de41eabd6287c1fddcb56c29bcd92c7fe","observation_id":"d3bd40fc-aa3a-4bb7-9e9d-1789d70b079d","resolution":{"observed_at":"2026-08-08T20:04:03.540802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-08T17:33:57.727194Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-08T20:04:02.202500Z","title":"What matters when building vision-language mod- els? arXiv preprint arXiv:2405.02246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.202500Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:208eb1283e603dfbebbdf3a6c0ab547b0797085cd9f1e6e938f25baaa9bd319d","observation_id":"a4077dbf-4bc7-4ede-b7ec-9613a7a755ea","resolution":{"observed_at":"2026-08-08T20:04:02.202500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.519408Z","title":"Autoregressive image generation using residual quantization","venue":null,"work_id":"7231804d-15d1-481b-91f8-f33d9616eaea","year":2022},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.206911Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:714d01858391ff9d6d1b046ee7bd261b58cc011fdb412913cd3c8e7ad59f64b0","observation_id":"2214d419-98f5-4334-8895-303afed07f3a","resolution":{"observed_at":"2026-08-08T20:04:03.524016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-08-08T20:04:02.211697Z","title":"Datacomp-lm: In search of the next generation of training sets for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.211697Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:426808b8c76baaa3fb1799c8c3ef0cd2af2d9c24996dc1915c8641995e2c9ce3","observation_id":"4a9100d2-60fc-4203-a762-1182eb0bc4dc","resolution":{"observed_at":"2026-08-08T20:04:02.211697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.504409Z","title":"Mage: Masked generative encoder to unify representation learning and image synthe- sis","venue":null,"work_id":"3121e1e0-c435-4995-8bf7-4aeaa956fb47","year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.216578Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:7a7a9bd590894768abfb96c8910ebb3c3b1a95305ad730ed7bb62ec46f7b8919","observation_id":"8eb81f88-1952-4d37-8eb9-4025db60a17f","resolution":{"observed_at":"2026-08-08T20:04:03.509256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.489941Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"0fd0f8a5-82a5-4387-aa21-a6ad7f73b8f1","year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.220361Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:56a461685a6db544431e344e3b468d373a25eedabc8a51ad5c004b3d148c0314","observation_id":"20778747-fe02-45bb-9223-4d91232e0709","resolution":{"observed_at":"2026-08-08T20:04:03.494385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.476259Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"de77c7d9-e17b-458d-a4d9-cc6013a936c1","year":2014},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.224653Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:909510b3a919dbd5611876a14eac6b5e21a678e2cdc76b35915621fc23a52c64","observation_id":"189cdc51-2d4a-4c52-9488-4c49d257c126","resolution":{"observed_at":"2026-08-08T20:04:03.480719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.228660Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.228660Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:650616e1c363739b5cd79e9629f6b20a0c03b9b729d04dd9863e88f68f423788","observation_id":"0952fad6-6b39-4b4f-9d53-f48ea7c7fc11","resolution":{"observed_at":"2026-08-08T20:04:02.228660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.453178Z","title":"Language quantized autoencoders: Towards unsupervised text-image alignment","venue":null,"work_id":"ff45bc0e-a247-4c58-a926-f6a1ce6e0fba","year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.232849Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:587840cd914749891d93a7b25ad36df0e5c08797244aa4ac55b3d32a491c2186","observation_id":"db0fce50-4a05-4b4c-bb37-dfcabc1c592f","resolution":{"observed_at":"2026-08-08T20:04:03.457846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.437772Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"690fee39-f418-4010-a7af-8d29f3059f32","year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.237764Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:928a655050c0707d0d567e2214e97adde1c9fa149391bb9d418b9ed9b2f78ef7","observation_id":"5595dd76-13a6-46ac-8d75-33a5649c7c66","resolution":{"observed_at":"2026-08-08T20:04:03.442955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.423404Z","title":"Unified-io: A uni- fied model for vision, language, and multi-modal tasks","venue":null,"work_id":"36fd68b0-37b6-480c-ba7e-bcb210ce6b21","year":2022},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.242074Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:6962e9289de9a392e32c09b7b794912333570d7b65e3a6cfcfbabaa5d4073742","observation_id":"ab91549c-e08a-40e2-984e-525243af81ec","resolution":{"observed_at":"2026-08-08T20:04:03.427785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.409665Z","title":"Unified-io 2: Scaling autoregressive mul- timodal models with vision language audio and action","venue":null,"work_id":"58763e25-6549-4ddc-a621-b53ff9ed3626","year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.246605Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:5c7c365ab5bfc00af1db675b13ee43bab3c2b5328f01a9e04457ae5789183459","observation_id":"fec7a35a-afad-492b-8035-5bd024506d7b","resolution":{"observed_at":"2026-08-08T20:04:03.414279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-06T03:43:29.067278Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-08T20:04:02.250674Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual gener- ation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.250674Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:c60b7c0b8131f0340e177955b9db4017f9b8c02eb51bc3eb07d908a1cf837edf","observation_id":"7e77d0d2-b0b7-446e-9b91-8b20da7b51cb","resolution":{"observed_at":"2026-08-08T20:04:02.250674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.395718Z","title":"Finite scalar quantization: Vq-vae made simple","venue":null,"work_id":"ac8b5139-d7c4-42e1-afee-2e212bb14217","year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.255181Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:b02cf785224783b51c0bee192c71639217a11b637ec415ba3fa5525a28b1b813","observation_id":"252c49b0-6672-4642-99e3-a5b1ec6bec32","resolution":{"observed_at":"2026-08-08T20:04:03.400187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-08T20:04:02.260427Z","title":"Repre- sentation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.260427Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:4077849b77d6071553644dbb2cfaff17190bfdcbf9e0601a62d4e53e08ee3101","observation_id":"4a13c14d-5261-4a09-a6af-fd51658da579","resolution":{"observed_at":"2026-08-08T20:04:02.260427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06366","last_updated":"2022-10-03T11:47:10Z","snapshot_observed_at":"2026-08-04T18:14:09.239336Z","submitted_at":"2022-08-12T16:48:10Z","title":"BEiT v2: Masked Image Modeling with Vector-Quantized Visual Tokenizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06366","snapshot_observed_at":"2026-08-08T20:04:02.265135Z","title":"Beit v2: Masked image modeling with vector-quantized visual tokenizers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.265135Z"},"links":{"cited_paper":"/paper/2208.06366","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:1f7e91eb60af75a103149c8065c039ae1a84df05aca289bcd3c4524561772f38","observation_id":"957365a5-9e76-4c88-85eb-300f411f3848","resolution":{"observed_at":"2026-08-08T20:04:02.265135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-08T20:04:02.270583Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.270583Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:3b77c8174a57c874311c80d6d360076be24e73554aa2cd0ecc63ee97a03ebc5c","observation_id":"579222c2-f70e-45c7-b5fe-90f53bb5ea27","resolution":{"observed_at":"2026-08-08T20:04:02.270583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.381331Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"ff327275-9d17-4353-9167-fe0faf22f95b","year":2021},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.274919Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:6e7ea4b198eea952ef9d0261c43461ced5dae905148fdce953b288e4a8137bef","observation_id":"ef1bc0ab-2f53-4a0c-8a65-83d6094d99fc","resolution":{"observed_at":"2026-08-08T20:04:03.386055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.366591Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"77c2e035-dba6-4076-ba24-e79f0d05a399","year":2020},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.278871Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:2c8247b1717c2703d564e8d76841dbf7e5a64efc80c9ef50eff92b35592c1416","observation_id":"c9d1c10e-48f9-4711-9b7f-197257a99594","resolution":{"observed_at":"2026-08-08T20:04:03.371521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.282886Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.282886Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:721983dad30f8d63b3c71f780721b9132c6ef77efd0bf0b2b54b465dbe95c64f","observation_id":"70c991cc-d2ef-4978-a734-efc4e8326a6f","resolution":{"observed_at":"2026-08-08T20:04:02.282886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.343185Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"83ea2279-c0db-4d7e-90eb-5b45862b35a4","year":null},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.287680Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:4187c9351bd26586c227a71248359c98cf63ba147169133368cb29ba3a2aa9cc","observation_id":"cf5a9212-2786-4c1b-92f0-4d52f8935b82","resolution":{"observed_at":"2026-08-08T20:04:03.347768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.328084Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"d8ae6ebe-57fe-475c-9068-1a33e0b82215","year":2022},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.292062Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:3834b7f0caa1ab723059f1db6ea8f7ebb91ee7e3a002100f703b98c29d575e07","observation_id":"d7a5a524-7b93-477f-a79e-5bf44a845d72","resolution":{"observed_at":"2026-08-08T20:04:03.332837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.297126Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.297126Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:853f267dce601749d9a79fb694fabc232f2cd8f50b266a3bb347ab06a93e154b","observation_id":"d8bea48c-add4-462d-a853-fe13f497a8bb","resolution":{"observed_at":"2026-08-08T20:04:02.297126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.306153Z","title":"SocialIQA: Commonsense reasoning about social interactions","venue":null,"work_id":"2fcf8d26-5a73-4995-a205-62429cd42658","year":2019},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.302005Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:0dfb1dacc1c3c42e112646470ead31e84e9bec2cfbdb8c6cf3bea05c0da604be","observation_id":"8f40caa5-dcec-44ef-96dd-85f5620d0a7d","resolution":{"observed_at":"2026-08-08T20:04:03.310139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.292606Z","title":"SBER-MoVQGAN or a new effective image encoder for generative models","venue":null,"work_id":"bf7b8e23-eaca-465f-8552-b98af4d9d264","year":null},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.306771Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:6ffaf21f933e50ef0888c07347ba82430282f506d6a6156ab0a810321047c12e","observation_id":"3ac211ea-e85a-4996-bc70-9f34a5f8aedd","resolution":{"observed_at":"2026-08-08T20:04:03.296907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.266223Z","title":"Laion coco: 600m synthetic captions from laion2b-en","venue":null,"work_id":"0f37bb17-50b1-42f1-ac25-048496e7dd14","year":2022},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.315752Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:bda130db238d01c301f38d96ab37072ad19e02048ea6712e30c139b4ba40ded2","observation_id":"a7e14180-f7fe-4cfc-8cdd-9b55d184716d","resolution":{"observed_at":"2026-08-08T20:04:03.270760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.252639Z","title":"Japanese and Ko- rean voice search","venue":null,"work_id":"4ad29fb9-cc32-427b-a694-170852850e8f","year":2012},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.320176Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:5cf7abc56cb75ce1564bcf98b04f7cd441bbec9495ea5dbda548b0991ff96747","observation_id":"6348c906-7c74-42d8-b82f-6f110828263c","resolution":{"observed_at":"2026-08-08T20:04:03.256999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.239248Z","title":"Multi-task learning as multi-objective optimization","venue":null,"work_id":"dadcd8e1-57e8-41ce-8bf0-b9d960120ffe","year":2018},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.324692Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:7c940081cd1bbbf145b3475f61cd53f2424ef069f269a5069d55f79290ada646","observation_id":"a9cb6e2f-c90b-4a91-8bfb-2fda825d10cf","resolution":{"observed_at":"2026-08-08T20:04:03.243667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.225631Z","title":"Neu- ral machine translation of rare words with subword units","venue":null,"work_id":"ffd92397-de1f-4d4f-b528-ae5176a556a3","year":2016},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.328915Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:1c6f599a93abb90f2eaf3612dfad6f3cc324fafc52d6bf19e7cf44a26a223c5b","observation_id":"5b528a2d-eeca-40fc-a17b-4f30eeaa8852","resolution":{"observed_at":"2026-08-08T20:04:03.230277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-07-06T19:07:16.252072Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-08T20:04:02.333188Z","title":"Eagle: Exploring the design space for multimodal llms with mixture of encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.333188Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:7a19bb15e70522744af82fbb915817de995fcc54ddfdc2acac9d19e0dfe29754","observation_id":"763974f5-2b29-4718-9563-692d710ec268","resolution":{"observed_at":"2026-08-08T20:04:02.333188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.212157Z","title":"Very deep con- volutional networks for large-scale image recognition","venue":null,"work_id":"bf69b995-7755-402f-92d9-df04653e66dd","year":2015},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.338045Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:c8175a2605f68341af54b6e2aad69de58a334d33f7d900cb03d89f48e9342f99","observation_id":"a79b9ac9-7ebd-480d-99b5-c170ebc32383","resolution":{"observed_at":"2026-08-08T20:04:03.216760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.198374Z","title":"Towards vqa models that can read","venue":null,"work_id":"92478a9e-7277-4aec-887c-d1b2beadd26c","year":2019},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.342447Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:fefc4c011920ed2d37de95b8601111c9efd30f5c2062181c2fed70bacc0828e5","observation_id":"3ed30314-8840-45f0-a088-3f3659833ef6","resolution":{"observed_at":"2026-08-08T20:04:03.202775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-08T20:04:02.346378Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.346378Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:8ae58f58a691f2665800f0c4a497992bfd406c3fddf8e3bb055668a3cccff2d1","observation_id":"1f0bda81-6ac2-4fb6-86f0-acb4f34fcbff","resolution":{"observed_at":"2026-08-08T20:04:02.346378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-08T20:04:02.350771Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.350771Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:0f63b215924aabbbe91f74463bb92ba04a41ff7cf07804d935c67b4731a24b6f","observation_id":"f9e9d59d-a110-4b33-a961-24993950a4dd","resolution":{"observed_at":"2026-08-08T20:04:02.350771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.184302Z","title":"Rethinking the inception ar- chitecture for computer vision","venue":null,"work_id":"40f16419-ae71-4802-b1fc-e34cdb0bf329","year":2016},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.355141Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:8e58a0ed16e49f23ee1ea3e4923479d4da73a276ee7b80a7a7d6978a354e12e9","observation_id":"6c28f588-8868-4027-bf90-ff5b54a965e5","resolution":{"observed_at":"2026-08-08T20:04:03.188991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-09T20:05:31.409634Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-08T20:04:02.359195Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.359195Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:085798c0e4552cb593d686034f12f6792ac77feaba63d134622d614386c8fa3b","observation_id":"a51555ff-f1f5-4c9c-84e1-ec308258bc67","resolution":{"observed_at":"2026-08-08T20:04:02.359195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-08T20:04:02.363640Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.363640Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:49a9c5d3cba7b285438a587ca87bea6e7af1bf41e0b10bd97bfaf4b30cb2193f","observation_id":"cf41c74a-f4c7-4a83-92e8-5d0bf36ab6e2","resolution":{"observed_at":"2026-08-08T20:04:02.363640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.170818Z","title":"Zerocap: Zero-shot image-to-text generation for visual- semantic arithmetic","venue":null,"work_id":"f4c20e39-88eb-48c3-b41d-75aa7e7afe09","year":2022},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.368347Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:9a3fefb2f318947e54c65168cd9d27e7cfa70df633315bce4a89023e932ea55c","observation_id":"5b9250a5-9f06-4cca-ac87-fe9296e98b1f","resolution":{"observed_at":"2026-08-08T20:04:03.175294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.156740Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":"0ae443fd-feda-424e-b70f-50e094b09a35","year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.372743Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:bac7c82bd0bdc4bd571e1ffbafa17a7fda5e76ab1fc9088b7cab31df70ea6f75","observation_id":"7d387ad0-554e-4504-b412-870f38858b29","resolution":{"observed_at":"2026-08-08T20:04:03.161572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.141985Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":"8579c98f-45cd-4921-9693-78f900410f84","year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.377487Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:d4c64f40cdfaca6610cedbf42f16059fc76a03972050a9fd2a620f0727c30678","observation_id":"5120663f-9535-485f-887a-87118f195826","resolution":{"observed_at":"2026-08-08T20:04:03.146572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T20:04:02.381765Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.381765Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:0b76f15117816b56aa95d486d431e72258fde9909c24e11550761ccdc1b9d5d0","observation_id":"4ef7273a-8b91-487c-913e-eeea0dfea38d","resolution":{"observed_at":"2026-08-08T20:04:02.381765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.129532Z","title":"Neural discrete representation learning","venue":null,"work_id":"f918209d-9852-46c5-9731-2f4ff2b7099c","year":2017},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.386558Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:b871e9144f5eab3441949d69a691e307ceb96274afe41171b4792aeab9be4578","observation_id":"54ea1290-4ad9-4b80-a076-ad1d10fac364","resolution":{"observed_at":"2026-08-08T20:04:03.133397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-08T20:04:02.390941Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.390941Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:3f31b5eb80bc28f90aa71994881d563c46a812a81f2e5adab5502a4825e59203","observation_id":"3c79048f-2f57-4847-90c7-e066fc8b41dc","resolution":{"observed_at":"2026-08-08T20:04:02.390941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-08T20:04:02.395739Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.395739Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:ce372e24b0257d70a92f63a5a0872cc3e6b5006b176d807e008c25b8bf3ef3ca","observation_id":"fe84ed4d-84af-4a46-995e-7f2fdec335e1","resolution":{"observed_at":"2026-08-08T20:04:02.395739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.115519Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":"fb65f26d-7a4d-44bc-bfe7-5b75a4085430","year":2004},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.399952Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:1bc7271b416576309856ee9743e0edb972e05918de8e0fcdb1b039dda174454b","observation_id":"afac164b-4635-4703-9a45-4c183a40e4aa","resolution":{"observed_at":"2026-08-08T20:04:03.120627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.102088Z","title":"Diffusion models as masked autoencoders","venue":null,"work_id":"619e3d08-2af9-44d0-8f48-afbb3aedb82f","year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.404211Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:756f5a8053aa94978e5a9c53dbc658b4d7af4b5aa6f2b8bfdfb6bc7d9e72dca4","observation_id":"5dbfe271-8bd9-4e92-94f5-23d6550ba9b5","resolution":{"observed_at":"2026-08-08T20:04:03.106327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.086685Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"d2510815-3758-4e19-bdce-4bdd8dc83c13","year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.408117Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:24133c16edec1c16f40dc9c296de3bbff07a4120e16e42bf47f9144a6660eaf5","observation_id":"6ccbb9ee-5de6-4445-b8b7-efc5d7d6f211","resolution":{"observed_at":"2026-08-08T20:04:03.091696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-08T20:04:02.412305Z","title":"Vila-u: a unified foundation model inte- grating visual understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.412305Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:c94d0622cc2dc8771ab784f424fc28300ce3f3b76e4149c519ccc9612db6fd52","observation_id":"21678f6a-67f3-4732-80f8-d69a1c6719e0","resolution":{"observed_at":"2026-08-08T20:04:02.412305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-08T20:04:02.416333Z","title":"Show-o: One single transformer to unify multimodal under- standing and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.416333Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:0973bbfab2ecc3b9306d8ac56138af17331d9c10d30ebb9a8a53bfa9857adec6","observation_id":"4ca01e07-7e29-478c-84da-50fb65cac641","resolution":{"observed_at":"2026-08-08T20:04:02.416333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.071008Z","title":"Vector-quantized image modeling with improved vqgan","venue":null,"work_id":"fd203f9b-2c33-4eff-97ce-df8e49cfe374","year":2022},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.420675Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:22243f14a1b9f2753312a8ebc51943659dfb69086dd7cd54a248668775c80fc2","observation_id":"11781f39-f765-4cfe-ba2a-9bcd7bb75604","resolution":{"observed_at":"2026-08-08T20:04:03.075755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.056222Z","title":"Spae: Seman- tic pyramid autoencoder for multimodal generation with frozen llms","venue":null,"work_id":"73231d25-e193-489e-badd-21e39deefb15","year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.424933Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:67c433ad7b713aca6562c9d14a8d2ea56ade8a702ffc65bf2e87cc15c61be56a","observation_id":"1b4ddafe-09af-4ef2-94c8-7fe345d7b8b8","resolution":{"observed_at":"2026-08-08T20:04:03.061179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.041386Z","title":"Lan- guage model beats diffusion–tokenizer is key to visual gen- eration","venue":null,"work_id":"92f78295-75ad-488c-bca0-b3b277c20c1a","year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.429265Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:7fce03def10718d8e72f6f9f161f8aed6a3f6fc5aad2651fdb77dc2eb58ffb0c","observation_id":"64b8f8ad-79f2-4ea7-9c33-1fd36c74b33b","resolution":{"observed_at":"2026-08-08T20:04:03.046218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-08T20:04:02.433718Z","title":"Mm-vet: Evaluating large multimodal models for inte- grated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.433718Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:e3e3e5d97f948610fc6f3bb13533cddb38f354ef5753b7c024f29679712fa489","observation_id":"bdece9a2-041f-4fa8-ab57-b22e7422889d","resolution":{"observed_at":"2026-08-08T20:04:02.433718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.026616Z","title":"Hellaswag: Can a machine really finish your sentence? In ACL, 2019","venue":null,"work_id":"a25c1abd-3ded-4dc3-95a3-069e2046bc17","year":2019},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.438286Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:b498ffe87246b59b37e856012ec47c8ea0b73bf5f8b64297f9926f9cc5159de8","observation_id":"bf3a4357-bba0-42f1-b08f-455a2bc8821b","resolution":{"observed_at":"2026-08-08T20:04:03.031418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:03.011820Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"e087cd17-05af-4404-b21b-04d55c87abeb","year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.442574Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:a933b75326d5ea4562b45a0f1bc6b6de7f8edd934ed6d0e06d8e1b6888cdfd58","observation_id":"394930f6-e2d5-40eb-9008-0dfd22aa5589","resolution":{"observed_at":"2026-08-08T20:04:03.016591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.447133Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.447133Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:31b467d0e8272acc9f89081942bee99c83d9a7834483d322a523605a0a1783e5","observation_id":"30127f51-8631-4c74-b980-39de953a66f7","resolution":{"observed_at":"2026-08-08T20:04:02.447133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07548","last_updated":"2024-06-11T17:59:53Z","snapshot_observed_at":"2026-08-05T21:17:06.014910Z","submitted_at":"2024-06-11T17:59:53Z","title":"Image and Video Tokenization with Binary Spherical Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07548","snapshot_observed_at":"2026-08-08T20:04:02.451468Z","title":"Image and video tokenization with binary spherical quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.451468Z"},"links":{"cited_paper":"/paper/2406.07548","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:b54e0a58bacfafad66f00aad99c0d44390833eed77a877c1f135a3b1f68bf149","observation_id":"0d66fc1e-a3a2-4698-87f2-d800bc7c8802","resolution":{"observed_at":"2026-08-08T20:04:02.451468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.987880Z","title":"Online clustered codebook","venue":null,"work_id":"66b8f929-c14f-4023-886d-6355fb76ef68","year":2023},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.456061Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:4116c5c6a48618276ad5a67a8b3222af4f09c76ee934314829284c20d0df53e4","observation_id":"54aca9c2-4c8d-4dc7-8e30-9885c2e3eafe","resolution":{"observed_at":"2026-08-08T20:04:02.992318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:04:02.971920Z","title":"Movq: Modulating quantized vectors for high- fidelity image generation","venue":null,"work_id":"fadfff33-1062-40ac-8827-d2c25d3a84b3","year":2022},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.460265Z"},"links":{"citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:09ac8f82f2fee533b817046314acd6e3ef22d6d9e9b4b215bfecfe7498e08aa2","observation_id":"89097363-e6d8-42b1-b2ac-dea405150346","resolution":{"observed_at":"2026-08-08T20:04:02.977744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T22:49:21.603620Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":43},"total_outbound_references":103},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 103 outbound references and 13 inbound Pith citation observations for arXiv:2502.05178."}