{"as_of":"2026-08-21T17:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5b38350376fa2147b8de7406ef0e6034fe728b19799cef0adcc9761fea99facc","coverage":[{"denominator":104,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:21:04.547305Z","state":"measured"},{"denominator":122,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":122,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:48:03.500362Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T00:04:22.542063Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"reference_index":141,"source":"pdf_text","source_observed_at":"2026-05-24T01:25:10.150459Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2405.14093"},"observation_digest":"sha256:3f8087fad2b65116fb4ad594c7fb985bf0f68da414a2e61c58ad2f7d4ceef1a8","observation_id":"ce6f86c3-8ae3-464c-859c-31cbe8c6bfc5","resolution":{"observed_at":"2026-05-24T01:25:54.412504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-08-08T15:04:29.442501Z","title":"Vargpt: Unified understanding and generation in a visual autoregressive multimodal large language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-16T23:48:47.443593Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.442501Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:b42db0b359af8c56f8b6b862fbb43ba102edc8b764f0773695953dc36dfed63d","observation_id":"eeeb5c56-95d2-4e74-ba1a-1502d5f79c9d","resolution":{"observed_at":"2026-08-08T15:04:29.442501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-08-16T11:48:03.500362Z","title":"MLLM-pt” de- notes the pretraining of DDT-LLaMA, “MLLM-ft","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14666","last_updated":"2025-04-20T16:14:28Z","snapshot_observed_at":"2026-08-20T00:13:22.937348Z","submitted_at":"2025-04-20T16:14:28Z","title":"Generative Multimodal Pretraining with Discrete Diffusion Timestep Tokens","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:03.500362Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2504.14666"},"observation_digest":"sha256:87c7c6dcb81f955690ab78c553fe7c7b8447a8b16aa493e663be9ef5e73abad4","observation_id":"18734500-4d57-4696-84bd-10f7449a3a0c","resolution":{"observed_at":"2026-08-16T11:48:03.500362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-08-15T21:01:59.260983Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13507","last_updated":"2025-05-16T12:31:17Z","snapshot_observed_at":"2026-08-20T03:38:07.521889Z","submitted_at":"2025-05-16T12:31:17Z","title":"Open Set Domain Adaptation with Vision-language models via Gradient-aware Separation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:59.260983Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2505.13507"},"observation_digest":"sha256:7d2d5a257080753950729ab9a496f4eec90822fd84c2e3618974ec9d34ad64d4","observation_id":"3678c49c-a694-4464-8743-21f60760af38","resolution":{"observed_at":"2026-08-15T21:01:59.260983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-16T07:03:45.766617Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:1fec60404ab8f1ce66552fa8e3520b67e14f92ca71df752e5d7e75a781109f66","observation_id":"e6b68b22-0eb4-4371-9e7a-5af03bd4b398","resolution":{"observed_at":"2026-05-15T14:50:59.753839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-08-07T12:18:35.569184Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24787","last_updated":"2025-05-30T16:48:14Z","snapshot_observed_at":"2026-08-13T04:32:44.496715Z","submitted_at":"2025-05-30T16:48:14Z","title":"Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:35.569184Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2505.24787"},"observation_digest":"sha256:324cbf234b4e07dbb6ed53789e0177d99bdd8b2dd8740ef0fd0a8fdee49c4802","observation_id":"20f41297-a7fb-4c90-beca-1ca735b99dca","resolution":{"observed_at":"2026-08-07T12:18:35.569184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-08-07T00:53:26.930717Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12609","last_updated":"2025-08-18T08:18:50Z","snapshot_observed_at":"2026-08-16T00:03:52.874784Z","submitted_at":"2025-06-14T19:10:22Z","title":"Not All Tokens and Heads Are Equally Important: Dual-Level Attention Intervention for Hallucination Mitigation","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T00:53:26.930717Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2506.12609"},"observation_digest":"sha256:ce8c290eb9855ca9ab054f97674df115819d57d8aac6473f192db1eeec392b86","observation_id":"712f8acc-f2d9-4f5e-a1d2-08fc799d6f78","resolution":{"observed_at":"2026-08-07T00:53:26.930717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-08-07T00:40:22.561926Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12830","last_updated":"2025-06-15T12:22:55Z","snapshot_observed_at":"2026-08-16T20:45:45.867125Z","submitted_at":"2025-06-15T12:22:55Z","title":"ComplexBench-Edit: Benchmarking Complex Instruction-Driven Image Editing via Compositional Dependencies","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:22.561926Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2506.12830"},"observation_digest":"sha256:6b142c86d82af775ec1d9d2ea1f0c2f44001582b47647537a8d629727991e6f3","observation_id":"84a7f1c1-7cc2-4716-a4de-cae359319d48","resolution":{"observed_at":"2026-08-07T00:40:22.561926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-08-06T22:43:04.966173Z","title":"Zhuang, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21022","last_updated":"2025-06-26T05:48:36Z","snapshot_observed_at":"2026-08-20T12:40:23.504106Z","submitted_at":"2025-06-26T05:48:36Z","title":"Instella-T2I: Pushing the Limits of 1D Discrete Latent Space Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:43:04.966173Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2506.21022"},"observation_digest":"sha256:99c8eccbf236d154dea47d4f79f49f8e0eaf85fb39edf742eaca4f6b6c4a0ea4","observation_id":"cd3cdd43-3777-40cd-aaf1-1e35af05d4e1","resolution":{"observed_at":"2026-08-06T22:43:04.966173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2603.04592","last_updated":"2026-04-19T16:23:58Z","snapshot_observed_at":"2026-08-15T03:59:13.424216Z","submitted_at":"2026-03-04T20:37:30Z","title":"From Static Inference to Dynamic Interaction: A Survey of Streaming Large Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T16:16:15.819622Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2603.04592"},"observation_digest":"sha256:8ad4cfd6695ca795d85b89bf333b70055d8702386104aa73c5c7b2e951c0b5c4","observation_id":"226e02d8-a9c5-477b-b69c-0990c34ccad1","resolution":{"observed_at":"2026-05-15T16:20:09.981818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-13T23:27:11.006580Z","title":"arXiv preprint arXiv:2501.12327 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-20T17:53:01.671184Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-13T23:27:11.006580Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:6a1d9118cb09f27583148e26a1a2d2a2de2d47886740a30fed751094d20889ae","observation_id":"07a519a3-d3da-46d2-b5f8-00102b18b19a","resolution":{"observed_at":"2026-07-13T23:27:11.006580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-08-03T02:34:01.603385Z","title":"arXiv preprint arXiv:2501.12327 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-20T17:53:01.671184Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:01.603385Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:e8e6c2e6cc72feaf1ae94a47c2a2fa65ae204a0849d0a8a643a6144809c50571","observation_id":"e988bc26-b644-4d96-aa89-0e5d9a344453","resolution":{"observed_at":"2026-08-03T02:34:01.603385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2605.18115","last_updated":"2026-05-18T09:24:39Z","snapshot_observed_at":"2026-08-13T17:29:03.398003Z","submitted_at":"2026-05-18T09:24:39Z","title":"WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-05-20T12:04:19.761430Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2605.18115"},"observation_digest":"sha256:5e05f0d227ec64fa0def4f44df6c5f59d122317735683d4c8cb8dde90b870cc3","observation_id":"bf8003dd-c19c-4a18-adff-8a871acc3f23","resolution":{"observed_at":"2026-05-20T12:08:15.816753Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-20T11:32:24.007847Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:5e40f3a5a5d1ff2afd74d185e3d23c99af02ce7e5b8eb5aaf91cce708cb26c43","observation_id":"996a1a94-c94d-40c6-8ce7-64ed0331975c","resolution":{"observed_at":"2026-05-20T11:33:14.285652Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:9988b2fa446b4c0b3167eb264249c99831db94399f21251c72d90ba2706b32cb","observation_id":"061a9d94-8747-45e3-a2a1-d89cc9b3bf21","resolution":{"observed_at":"2026-06-30T18:35:00.311433Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2606.08302","last_updated":"2026-06-06T18:58:26Z","snapshot_observed_at":"2026-08-06T09:32:24.096311Z","submitted_at":"2026-06-06T18:58:26Z","title":"HACK++: Towards More Effective Head-Aware Key-Value Compression for Efficient Visual Autoregressive Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T19:46:43.514413Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2606.08302"},"observation_digest":"sha256:fb4d62a945fda37e00c485df8c3ca8cf17ec285839f0026a07ae2eb7c3d15ee6","observation_id":"39ee1ca7-63ea-49ae-acd4-15ccf867488d","resolution":{"observed_at":"2026-07-02T21:27:24.385865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2606.27376","last_updated":"2026-06-25T17:59:57Z","snapshot_observed_at":"2026-08-13T08:13:11.519782Z","submitted_at":"2026-06-25T17:59:57Z","title":"Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T04:58:15.891214Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2606.27376"},"observation_digest":"sha256:bf0523413780e95f4eb03c2c25049869da5dd28bc8ff68fee1e100cff5a84d8f","observation_id":"8263a698-25c9-4f07-839f-f4a8d6190a4d","resolution":{"observed_at":"2026-07-04T13:39:51.492070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2607.00371","last_updated":"2026-07-01T03:11:21Z","snapshot_observed_at":"2026-08-12T20:47:48.531525Z","submitted_at":"2026-07-01T03:11:21Z","title":"MEPA: Multi-Scale Representation Alignment for Visual Autoregressive Modeling with Mixture of Experts","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-02T15:14:36.946247Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2607.00371"},"observation_digest":"sha256:b78a292a87ea488ff6eab1ec0b03ea78005f0816df778cb81bd2191c9cd0d8e6","observation_id":"e4e52c5d-0910-439e-b9d3-a27e11303402","resolution":{"observed_at":"2026-07-02T15:17:07.191767Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-19T04:43:08.967042Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":268,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:2ed464901ff6ebff30400ba57536f4e4d100736faa470ded453c6a00dd18943b","observation_id":"158619c6-8924-48c6-82e8-3e8a88ce896a","resolution":{"observed_at":"2026-07-08T00:04:22.543433Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2501.12327 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-19T04:43:08.967042Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":268,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:880701396089cc497df169741fe6158bb9cebcad9788e9ccadf95e72c883d6d1","observation_id":"c4f225b9-d26d-4fc4-bedc-b1cc4b7b8c79","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-31T22:25:12.526450Z","title":"Segment the second person from the left","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.526450Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:afea645eaef88842d0686c42798f77d9260564044c03fa0b65a4379a7870cdc7","observation_id":"2483e1c5-8177-4b4e-be7f-ee2e17676c4b","resolution":{"observed_at":"2026-07-31T22:25:12.526450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-08-12T00:44:46.078357Z","title":"A blonde ponytail European girl in a white shirt","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07948","last_updated":"2026-08-08T06:23:48Z","snapshot_observed_at":"2026-08-15T05:52:24.898852Z","submitted_at":"2026-08-08T06:23:48Z","title":"SynVAR: Synergizing Spatial and Semantic Alignment in Visual Autoregressive Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T00:44:46.078357Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2608.07948"},"observation_digest":"sha256:9450e1bb2cd6f90746a42a88085ff5b24e393534d5483bc6d086576c53168623","observation_id":"e391844b-f528-4ed1-bb93-78e823d1782e","resolution":{"observed_at":"2026-08-12T00:44:46.078357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12327/citation-record","integrity":"/paper/2501.12327/integrity","json":"/paper/2501.12327/citation-record.json","paper":"/paper/2501.12327"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.055182Z","title":"Albergo and Eric Vanden-Eijnden","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.055182Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:1af1513810f1303cfdac95343b65dfbe62ad04a9be58ab7ff5e049906e02e032","observation_id":"02ef5ae7-22ec-402d-8993-4ca00f815ea1","resolution":{"observed_at":"2026-08-10T17:21:04.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T17:21:04.060897Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.060897Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:2d768992405b75617f4272d6fa553b3f1ddb58d4de24ab584f6300af79eed1ae","observation_id":"a7091db3-b8a5-4832-b0ac-8719fe9ba569","resolution":{"observed_at":"2026-08-10T17:21:04.060897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.066545Z","title":"messages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.066545Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:f3b7bdf5dcd96724c9f57044b93265fdc3993d0aca50f194017221e6c0224a2d","observation_id":"687c7d63-90b1-4a60-b1ea-791b5c9e0375","resolution":{"observed_at":"2026-08-10T17:21:04.066545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.071756Z","title":"Analytic- dpm: an analytic estimate of the optimal reverse variance in diffusion probabilistic models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.071756Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:87a27a8aed7c5029a3e0e5f1022c211be2dc29a51eac87d2e58539792626f6e9","observation_id":"78110544-edc4-4cf0-a5c4-ebec50a60318","resolution":{"observed_at":"2026-08-10T17:21:04.071756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-10T17:21:04.076616Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.076616Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:83b5d7eb01b4654474949834712849dcabfa323a2cd87174d9117e112fd16ed8","observation_id":"1ec4130f-6976-4b60-ac31-064da350ec4b","resolution":{"observed_at":"2026-08-10T17:21:04.076616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00425","last_updated":"2024-06-10T15:21:41Z","snapshot_observed_at":"2026-08-18T12:56:00.724645Z","submitted_at":"2024-03-01T10:21:52Z","title":"HALC: Object Hallucination Reduction via Adaptive Focal-Contrast Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00425","snapshot_observed_at":"2026-08-10T17:21:04.081816Z","title":"Halc: Object halluci- nation reduction via adaptive focal-contrast decoding.ArXiv, abs/2403.00425, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.081816Z"},"links":{"cited_paper":"/paper/2403.00425","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:a1dae290a84e02be4a92e70488c89dba57415edb4fabf83650ad9a53998bbd38","observation_id":"c19ee446-7ef1-4332-9b85-34e2226e1571","resolution":{"observed_at":"2026-08-10T17:21:04.081816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.087133Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.087133Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:7ebf64f46ee26bd8e17d8cfa2d44eccc640fc324d1481edbe9336ae21a80fc17","observation_id":"eaf80934-d9d7-4a17-8708-d5024abaf709","resolution":{"observed_at":"2026-08-10T17:21:04.087133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.092153Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.092153Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:f50f0fe4d16a8f2fe6284911a9442989312b6d9787022c7bda48771bd1a6ab3c","observation_id":"e00e5a9b-bcb2-493e-b511-a2ae577baac3","resolution":{"observed_at":"2026-08-10T17:21:04.092153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.097084Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.097084Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:122ccca223842330cacd6d3e4f562addd5fac0184ab9e7678728056feaa2248e","observation_id":"c819938f-f686-4df2-bff3-4272318f25c8","resolution":{"observed_at":"2026-08-10T17:21:04.097084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.107444Z","title":"Deepseek-v3 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.107444Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:b96111410aa199d58b6371a37ac27bfee6607b755c04079b164ee89aa28b7044","observation_id":"7e567638-7001-4bb0-a5a9-4c0278796200","resolution":{"observed_at":"2026-08-10T17:21:04.107444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.113109Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.113109Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:e01e16346a970247ecdd2b2abe16576b08bdaab8f70b3c312c7c66396eca6d91","observation_id":"cc5976e8-5f6c-4489-8476-096b526b951e","resolution":{"observed_at":"2026-08-10T17:21:04.113109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.117969Z","title":"Cogview: Mastering text-to- image generation via transformers, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.117969Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:59eb4ec95dfec2ba4b6f2de647c0f46afabb6db53f78f1663df3ca85417d0917","observation_id":"ccaabffa-b2e6-4969-a60d-0cf3c5f7e961","resolution":{"observed_at":"2026-08-10T17:21:04.117969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.122884Z","title":"Dreamllm: Synergistic multimodal compre- hension and creation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.122884Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:e461d5a926b6837efdb890711a5bfe9dc746e681945570ccda0594e952bd29cf","observation_id":"e2ba1748-3173-4c43-9221-9c2e8c359b3c","resolution":{"observed_at":"2026-08-10T17:21:04.122884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.127322Z","title":"Taming transformers for high-resolution image synthesis, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.127322Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:584c3fd5a33dbe27bea1335abe5a89253f037330c61ba512124c88d301b78c51","observation_id":"8187f5d8-4eae-4649-b2f8-30c8dfab353a","resolution":{"observed_at":"2026-08-10T17:21:04.127322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13863","last_updated":"2024-10-17T17:59:59Z","snapshot_observed_at":"2026-08-18T20:25:20.454774Z","submitted_at":"2024-10-17T17:59:59Z","title":"Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13863","snapshot_observed_at":"2026-08-10T17:21:04.132171Z","title":"Fluid: Scaling autoregressive text-to-image generative models with continuous tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.132171Z"},"links":{"cited_paper":"/paper/2410.13863","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:f1e0f06583c78f743aa18902d10aea304cfcbd80d0169f72b541acbb1c4b6505","observation_id":"6b7f01ba-b9f6-4e40-a94a-3baf2bb28b9f","resolution":{"observed_at":"2026-08-10T17:21:04.132171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.137915Z","title":"Mme: A comprehen- sive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.137915Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:54ab4a9c78d1c41cffc221d8e3a2e807e7151006eb1e7a03e02bd87266481032","observation_id":"4b049a85-1fee-4821-b33f-9a53edb8b170","resolution":{"observed_at":"2026-08-10T17:21:04.137915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.142561Z","title":"Making llama see and draw with seed tokenizer, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.142561Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:c437a49eaee410258f4e9980aa7c133505d6f4672124732a537a43368b71f7fa","observation_id":"7db3e256-48c4-40de-8a5e-8aa20d838f68","resolution":{"observed_at":"2026-08-10T17:21:04.142561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-10T17:21:04.147572Z","title":"Seed-x: Multimodal models with unified multi-granularity compre- hension and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.147572Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:cc627b1172dffea670399a97ed7919496abf856374fab10d4a4a1c0986b6e90c","observation_id":"c7e95b52-af29-49cd-8716-f2adb530d859","resolution":{"observed_at":"2026-08-10T17:21:04.147572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.152825Z","title":"Making the v in vqa matter: Ele- vating the role of image understanding in visual question answering, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.152825Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:cd358d9ed9b69c939ef43cc0030f5bcb4b98dc656964e4f9cff4cf12c0d7a42f","observation_id":"395f0c5e-97e6-4b70-9bcb-f6804c9c849e","resolution":{"observed_at":"2026-08-10T17:21:04.152825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.157578Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.157578Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:4fc8fffb1973b00f8c67cbb74fd6548c503661efb06b91a9d196e84b71d582ac","observation_id":"ad7bb450-fe95-49f0-bc2c-078aa624bb27","resolution":{"observed_at":"2026-08-10T17:21:04.157578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.162915Z","title":"Stangl, Anhong Guo, Chi Lin, Kristen Grauman, Jiebo Luo, and Jeffrey P","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.162915Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:b01dd98a4faaaf96c37561f44d3c687a021ea515e72a0afc61b0785f9d590065","observation_id":"de348b17-ce73-4b05-a90d-647049fd6fb4","resolution":{"observed_at":"2026-08-10T17:21:04.162915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.167558Z","title":"Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.167558Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:ebf068d5e1dbeea2cb7af10b34c323021ac415247e3d80f17adc897cf29bb72b","observation_id":"fd96de1b-a8e3-458e-94ae-45c05faaf459","resolution":{"observed_at":"2026-08-10T17:21:04.167558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-10T17:21:04.172479Z","title":"Scaling laws for autoregressive generative modeling","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.172479Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:519e76b9deda33b5e4190ce5874b728df6a8ad43d388f0d69e27e7d9ffae8f9b","observation_id":"83199dc8-7144-4c07-b62f-6f31345dea6e","resolution":{"observed_at":"2026-08-10T17:21:04.172479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.177268Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.177268Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:a38e5d237fed4c49286b698bef4533eaf90a582a423f6d90f4bd46333210a9df","observation_id":"6a913b5d-76b8-4ff4-9ac7-5456d24a75dd","resolution":{"observed_at":"2026-08-10T17:21:04.177268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.181964Z","title":"Denoising diffu- sion probabilistic models, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.181964Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:ea8e16ac8d7dc496c684f1c0b785a500fe2e914e9cb62eb370857913c1f0cafb","observation_id":"e14c0d7f-ef16-40b3-893b-5cb64c3118df","resolution":{"observed_at":"2026-08-10T17:21:04.181964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.186599Z","title":"Fleet, Mohammad Norouzi, and Tim Salimans","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.186599Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:9e01c708831ae887adee69b86f8bb9822da80766e51acb2fd5aa650c1fa63f83","observation_id":"c710cb36-5d00-4c49-99b7-f9ba42f719a9","resolution":{"observed_at":"2026-08-10T17:21:04.186599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.191427Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.191427Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:92fe9729a87f369b637d4af003c53bedb373654b043873146be516292ea00c0b","observation_id":"05c48a21-3f0f-415d-b190-9e083acc0075","resolution":{"observed_at":"2026-08-10T17:21:04.191427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.196480Z","title":"Hudson and Christopher D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.196480Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:c2f1c12812cef1dde38c2201ac68dd0df07155e2a514c817f38aeaf2f09ca0ff","observation_id":"077c2209-9771-4993-9318-d9fca4d48144","resolution":{"observed_at":"2026-08-10T17:21:04.196480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-10T17:21:04.201224Z","title":"Scaling laws for 20 neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.201224Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:d83a8a50626fce7ec2670696187a189242e0d0393b977d997fba211d5f98d81c","observation_id":"1473683f-a911-4071-a4b0-79ac04e25f79","resolution":{"observed_at":"2026-08-10T17:21:04.201224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.206167Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.206167Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:8809ba60dafe0c5074ee8a2f091fbd93881a3e978839695a4407268c8d5b8fe7","observation_id":"a59168d2-cd0d-417f-a551-f25d6a825290","resolution":{"observed_at":"2026-08-10T17:21:04.206167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.833343Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":"64ad641d-61f8-47b8-9b09-9362363a041d","year":2017},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.211116Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:f43e1b3c92d7e5dc79ab06629ea89b13cf9661cef3c036433660d431040a80fc","observation_id":"edafc5d2-ee27-42f5-a95d-57ac40f5108d","resolution":{"observed_at":"2026-08-10T17:21:05.838318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.817558Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":"8d1eecc8-2aea-4e9e-a21b-50fde9835509","year":1956},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.216098Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:e088111a919593031cd97a21743f3ddf83e83208e1ca70810489c0b22ea9ae8b","observation_id":"76c23acd-d042-4fa4-92df-e026d85caa07","resolution":{"observed_at":"2026-08-10T17:21:05.823150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.802292Z","title":null,"venue":null,"work_id":"29636a46-ea75-4d4a-94d1-c30c3c3ed7e4","year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.220768Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:92c9a642d05a814ce72776bef646f1ca75ede095959217870acfabef586aa91d","observation_id":"6b1f51eb-97d4-4ad2-8abc-b868ad943db6","resolution":{"observed_at":"2026-08-10T17:21:05.807189Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.787370Z","title":"Datasets: imagenet-1k-vl-enriched","venue":null,"work_id":"9bc2aa95-cb22-4f40-b5d9-1934f29192cb","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.225733Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:c59d427aad4e32f743abecd783d9a6c83b11d7ef2edce6a7cf430e3c97ed9ce6","observation_id":"a2674656-240c-47d0-8726-57db70b158b6","resolution":{"observed_at":"2026-08-10T17:21:05.792194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.772539Z","title":"Deep learning","venue":null,"work_id":"8e6c56e6-d798-41c7-a42a-a5331abfc37c","year":2015},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.230513Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:3ff9a4eb2b288dd3e013d3cf65450a90f05cdc5b21322c95a5bc5fca616d0f29","observation_id":"b1af209a-5da4-4f7b-9133-5f254b5b1a4a","resolution":{"observed_at":"2026-08-10T17:21:05.777349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.757135Z","title":"Autoregressive image generation using residual quantization, 2022","venue":null,"work_id":"e85606e7-617c-42e0-b578-aff207e0b4e3","year":2022},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.235485Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:26a234a8cbbb23551c9fc873c6503b8915e2c127242041246d21e286b64cfeea","observation_id":"ebbe9e8b-7c63-4326-914a-90bf4f6025bd","resolution":{"observed_at":"2026-08-10T17:21:05.761859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16922","last_updated":"2023-11-28T16:26:35Z","snapshot_observed_at":"2026-08-18T12:55:28.536184Z","submitted_at":"2023-11-28T16:26:35Z","title":"Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16922","snapshot_observed_at":"2026-08-10T17:21:04.240341Z","title":"Mitigating object hallucinations in large vision-language models through vi- sual contrastive decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.240341Z"},"links":{"cited_paper":"/paper/2311.16922","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:6d43b4d1950c25f3451700eb89b3dc6063266b767bf40f7e1e99f455dd083880","observation_id":"c5d0fb22-0895-45e8-8094-17af05f79de6","resolution":{"observed_at":"2026-08-10T17:21:04.240341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.742083Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension, 2023","venue":null,"work_id":"ef17bd7d-c69f-4f3d-ab41-a3abb4405ded","year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.245178Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:a1708321b62fc7ca850a90a0a3fa7b690324f392232e1aa87ce56e19b9c82dd1","observation_id":"c690a647-abe8-4335-87f0-ebd032a52f8a","resolution":{"observed_at":"2026-08-10T17:21:05.746758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.726919Z","title":"Llava-next: What else influences visual instruction tuning beyond data?, 2024","venue":null,"work_id":"1ea064c1-37b1-4439-9d94-4fcd1335e8cd","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.250131Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:b92bae94e6a5e1885ea8e32522d889b5d7d77c4012cf6a2df8356c5d28a1d4d5","observation_id":"5840bd26-27e1-476a-acc6-65ef61c90cda","resolution":{"observed_at":"2026-08-10T17:21:05.731951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.712154Z","title":"Llava-next: Stronger llms supercharge multimodal capabilities in the wild, 2024","venue":null,"work_id":"c7b4ee87-d50e-453b-8b4f-9c37692e110f","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.254643Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:6d218fe7d3aa6b0e4b7dce2e2638d67b7f7eb909335895ad553676a09b71ffad","observation_id":"a75f6018-7d76-4c07-888b-d6a32297b8e0","resolution":{"observed_at":"2026-08-10T17:21:05.716817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.697403Z","title":"Llava-onevision: Easy visual task transfer, 2024","venue":null,"work_id":"7ce01d78-735f-43e7-91ec-1fecc49ca30d","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.259415Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:0c726d762a9f5c466222fdbc1851c78b9c3ff58782fb60c3429f68a839517cd5","observation_id":"94b0743b-231f-45f1-946c-d4c93240bdb2","resolution":{"observed_at":"2026-08-10T17:21:05.702250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.682549Z","title":"Llava-next: Tackling multi-image, video, and 3d in large multimodal models,","venue":null,"work_id":"fdada72a-fa45-41f3-86b7-dc3a868fee5a","year":null},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.264372Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:203f1786993f81d882e174a97a2d0e0c9ec7b3e461d3d2df7c3bdbae9c43bbc9","observation_id":"58bda4e4-2289-47ce-ad53-f14da0f948d4","resolution":{"observed_at":"2026-08-10T17:21:05.687367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.667232Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"362fed1c-b487-4ad4-8db8-176100035538","year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.269031Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:57ee0a3a97af5213543d15e0f3cd46ee0fe69f433cb6f19cb3aee30548a35e6f","observation_id":"d0023b5b-6601-469d-a346-fd2e97af8db9","resolution":{"observed_at":"2026-08-10T17:21:05.672425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.651428Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models, 2023","venue":null,"work_id":"a525c6f0-5a63-4bd0-9c85-7c81d6eaf40c","year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.273858Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:1da20355d0562fcafdac26f01cb73ef4beff8e861c1b93eef90e43a41e2eaaf5","observation_id":"53ab4899-7181-43f8-a309-a5e25a2ed6b7","resolution":{"observed_at":"2026-08-10T17:21:05.656693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.636079Z","title":"Evaluating object hallucination in large vision- language models","venue":null,"work_id":"0065a0b4-5fb0-4223-899a-f3f45853693f","year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.278654Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:271576cc4b175cd1f02004d2d2e11a957cf5ae320ac47b7549719ed5601b47db","observation_id":"3b873459-04b5-4fb5-b0f4-0d25d8fa23a4","resolution":{"observed_at":"2026-08-10T17:21:05.640969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.620194Z","title":"Dual diffusion for unified image generation and understanding, 2024","venue":null,"work_id":"169be219-e13c-400e-adf3-c3ad978347a6","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.283580Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:600b1b6f7053e09ec7217aaf0e6ec86cd9b68cfc2e1a235c1d07b75344ae10d1","observation_id":"2c4a206b-008a-4440-ad1f-e8d0e1bc9402","resolution":{"observed_at":"2026-08-10T17:21:05.625246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-10T17:21:04.288423Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.288423Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:c01acfb7f31c92fc9c21c9a2332b620bbd0a136769c85358fd49b2712ad77f86","observation_id":"7f25221c-d942-4d8b-919a-cd855aff610c","resolution":{"observed_at":"2026-08-10T17:21:04.288423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-10T17:21:04.293521Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.293521Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:5e3e3bdf71948eee64331c3c95626f892f50ac1bf6e80b501ef5456b174b27d9","observation_id":"bfdfb097-5980-4de6-83ca-b0cf21c628b3","resolution":{"observed_at":"2026-08-10T17:21:04.293521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.604209Z","title":"Visual instruction tuning","venue":null,"work_id":"b8516f57-c807-47a1-bb62-c773e2229989","year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.298785Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:8cf00dcb70667d7ec0bc0e454a9f197462bfa278dae55adb2831233fa36af4aa","observation_id":"878d5f9d-8086-4274-92d0-89b11770d923","resolution":{"observed_at":"2026-08-10T17:21:05.609283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.588634Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"3bc51c23-0be6-4061-bc0b-e8b0b0594554","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.304374Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:db76108eab6779ee7a6133c2db0c46f718732a402b9874d26cc09344095d7cdd","observation_id":"401fee1b-c74a-4080-9fdf-84cc84033a6c","resolution":{"observed_at":"2026-08-10T17:21:05.593616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.573713Z","title":"Improved baselines with visual instruction tuning, 2024","venue":null,"work_id":"c8c6a3c3-451f-4110-bb08-7832811caf4b","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.309619Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:47a2f91af612b0f50479e22aa891b1fd3a51d59b62c6f39e20bb1c4f12cc982e","observation_id":"1e21cf32-bc91-4ed1-bd31-3ecdcce2692c","resolution":{"observed_at":"2026-08-10T17:21:05.578610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.556927Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"1eaedd87-d4e7-44c3-9d44-062cd0af90e0","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.314855Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:636c973e16f41e4fbfdea8fc2791c767b24d4c2f92ffff47c2a7c94ed8793226","observation_id":"821f2ff4-a50b-4d46-86e5-e27b39403060","resolution":{"observed_at":"2026-08-10T17:21:05.562380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.540327Z","title":"World model on million-length video and language with ringattention","venue":null,"work_id":"fd1d28e0-a5dd-41ff-abdc-65a1b89dd375","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.319618Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:a7c00e4a06b867ba58ee27396fefec027d87db426698fd796690b844804eb73e","observation_id":"367b11ed-4739-47f0-852c-cdacab181abc","resolution":{"observed_at":"2026-08-10T17:21:05.545290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.523630Z","title":"Mmbench: Is your multi-modal model an all-around player?, 2024","venue":null,"work_id":"75c28a17-755b-4726-9c47-7cee5b648806","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.324310Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:8cedd520de9c32b8f8a15ed5c8a7f0dbc11b618c7e92fc8c012c82705a3db34c","observation_id":"ee285e19-6127-4fdf-be4f-100c99da170e","resolution":{"observed_at":"2026-08-10T17:21:05.529584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.506721Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps, 2022","venue":null,"work_id":"03863ac0-307c-454f-980b-645a26a43119","year":2022},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.328973Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:bccc704742619641a481471ced922222bf0dce621fd45f7c45a60e0a7496cab2","observation_id":"93a6883f-d62b-40bd-b416-7dbb7e0339c3","resolution":{"observed_at":"2026-08-10T17:21:05.511965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.489377Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering, 2022","venue":null,"work_id":"10b8e76b-fefe-4abe-a5f6-ccfcba4073c3","year":2022},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.333752Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:fe0c09681e988a1411c5bf5e4882264ade091e61f9936be9118bfa25f7275e66","observation_id":"0232c3dd-4465-4a54-a616-ba7197d81649","resolution":{"observed_at":"2026-08-10T17:21:05.495366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.473426Z","title":"Unified multi-modal latent diffusion for joint subject and text conditional image generation, 2023","venue":null,"work_id":"8c86f8d0-04e6-4874-9ac8-af8fd5dd0f3c","year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.338929Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:01d9a0211253dd592bf090b2e3bf0575831850666064a773e80324b804d4f63c","observation_id":"84008c93-d13a-40c1-97d6-d1ef4d9b0602","resolution":{"observed_at":"2026-08-10T17:21:05.478887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.343869Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.343869Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:8d964016328911179b5134103b61fa806bac91e3183498cadeda4815fc241fed","observation_id":"4f9e81fe-ab55-47af-8ea5-e797451337d0","resolution":{"observed_at":"2026-08-10T17:21:04.343869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.447243Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge, 2019","venue":null,"work_id":"c609df7f-05c3-4e32-a762-22bedbace6fa","year":2019},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.348553Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:166d424171592a123793db0c6905656e17fa005615f2d577027bc90e378c0247","observation_id":"ed88223d-20e4-4c11-bdf6-8c549e1d9350","resolution":{"observed_at":"2026-08-10T17:21:05.452449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.430832Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"8d429a4a-bc40-40e1-9826-0cbbeb4c8436","year":2019},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.353053Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:be05ae870e673398a0df916e9fab7db3a840e7d8eb2adbbff1dd56f80a1bd5ca","observation_id":"5f1c9815-c403-4bae-99fb-b01ac8f9e695","resolution":{"observed_at":"2026-08-10T17:21:05.435954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.357580Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.357580Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:e7e4748cf7050ce5d9dafc64a00f9227992a6258fa64d77b1721fbbc43ab589b","observation_id":"d3395c2d-6c74-44b1-aeea-bb2680354427","resolution":{"observed_at":"2026-08-10T17:21:04.357580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.362267Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.362267Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:3ab45aac4ed13d89a9f51e214267ff28b17a05726e6813862023ce30a8be6930","observation_id":"2949aca0-29ff-4e41-ab65-d58979c19940","resolution":{"observed_at":"2026-08-10T17:21:04.362267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.367146Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.367146Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:dc5ea376c138e502ccac9da7821241f05be95c175cd049de3c5cccb59d11ff0d","observation_id":"6adfc238-4cb5-4864-b2ab-f49da80dc63b","resolution":{"observed_at":"2026-08-10T17:21:04.367146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.382682Z","title":"Du, Zehuan Yuan, and Xin- glong Wu","venue":null,"work_id":"d613c7e6-1be5-425d-9c03-2c48ad1f8ecb","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.371864Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:96df5d2576ba129857b78a13ba609aaa939513aeda23742b9f05e28d30caf355","observation_id":"d4f27e65-f17b-4304-a135-edd8c59b979e","resolution":{"observed_at":"2026-08-10T17:21:05.387857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.376519Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.376519Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:278ca506b854cd792b89c9ebaf8248d0b136b558d77d28fdd500eaefd0e95ac5","observation_id":"3cf0f681-042d-4c4c-9b7a-5ab69a9c262a","resolution":{"observed_at":"2026-08-10T17:21:04.376519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.381413Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.381413Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:9878dffc2c4cc9615e771b6b2dc8ee9f6b9ab0be58ff23472e7fb4ba65e09079","observation_id":"5e957856-07e5-46f2-9882-ad0d28dbbb64","resolution":{"observed_at":"2026-08-10T17:21:04.381413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.386393Z","title":"Zero-shot text-to-image generation, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.386393Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:fa21219296a558129af7e9f489ad29e08a12e40b6bcbc2d755b1d8606b6abba2","observation_id":"5dedcf49-fcdc-44c6-a8a6-a2a7723e72b1","resolution":{"observed_at":"2026-08-10T17:21:04.386393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.336131Z","title":"Hierarchical text-conditional image genera- tion with clip latents, 2022","venue":null,"work_id":"a3e99538-a901-4d51-a33f-e1c7dfc3d944","year":2022},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.391482Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:8436fcf6043e752d7798c6853f266f834e9c0bd360c071050aae1caeda722db2","observation_id":"672f3e67-c3be-4d75-a9e2-eabc8f8a6676","resolution":{"observed_at":"2026-08-10T17:21:05.341071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.319167Z","title":"High-resolution image synthesis with latent diffusion models, 2021","venue":null,"work_id":"0f76e141-1a40-472d-8f7c-f13fd3a88828","year":2021},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.396305Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:0c49cb6d4874f88761e1f935910d35dade56a0fc8b3115eb8fd8bd8b98d38738","observation_id":"504fc21f-a55a-4ce4-8205-1b4882b92f90","resolution":{"observed_at":"2026-08-10T17:21:05.324461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.303356Z","title":"A-okvqa: A bench- mark for visual question answering using world knowledge","venue":null,"work_id":"6103ee72-b488-429f-aa17-77c4f855870a","year":null},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.401232Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:ab478d93208e1a72f0876e40cba3a45b76e8b48f3508bc0f0f15cbac311d27b2","observation_id":"64eed9d4-bce1-4264-95ed-7368ce130d2f","resolution":{"observed_at":"2026-08-10T17:21:05.308472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.287371Z","title":"https://sharegpt.com/, 2023","venue":null,"work_id":"ade79f3a-45bc-4ec2-81f9-88dd071dad87","year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.406214Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:922db32637f0308f461d7c27e9ecbf7a44f53aa0da5ac41b833cc3bc6d6fe660","observation_id":"3b30c682-79a9-4642-8646-a0cc7866efa5","resolution":{"observed_at":"2026-08-10T17:21:05.292565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.270353Z","title":"Textcaps: a dataset for image captioning with reading comprehension","venue":null,"work_id":"2558e46b-fbf4-47d5-831d-7cf76a04a01c","year":2020},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.411103Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:29928381ff05e1bd32088f3d0d3c446dac3d0fbf59d0509e0e50ad105d71b62e","observation_id":"4f535246-2cb0-49a0-b2bc-4420abf03743","resolution":{"observed_at":"2026-08-10T17:21:05.276429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.254387Z","title":"Towards vqa models that can read, 2019","venue":null,"work_id":"7074bb77-0d9e-4743-9f46-33f39dd04b3f","year":2019},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.416070Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:aa785c14915d2785b6f6ddd9c3f6600c60801b2fadaaae1a29634d9a8ff2e11e","observation_id":"78a7022f-34f2-440a-af68-a4048fe072ce","resolution":{"observed_at":"2026-08-10T17:21:05.259803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.421214Z","title":"Denois- ing diffusion implicit models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.421214Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:5d5142d30ccdda083025c48ee81334cc8aeda9cc1bb6e6af52f32493c945b35d","observation_id":"c884e091-49c7-49de-bc2f-8a41d6eb0565","resolution":{"observed_at":"2026-08-10T17:21:04.421214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.228497Z","title":"Generative modeling by estimating gradients of the data distribution, 2020","venue":null,"work_id":"11d0274f-7a86-4bd0-9300-e25b6cfbcd8e","year":2020},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.425900Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:7433873b80b255de1ca369140af6845f00c99097687bbbf526b35a0700021848","observation_id":"f336a288-88b0-4b96-9958-bab1ceaad257","resolution":{"observed_at":"2026-08-10T17:21:05.233418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-10T17:21:04.430791Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.430791Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:adf9731cb0adb200046027915732d255bd0452a1f1d8e41a5fa599a15d87d8b4","observation_id":"f557c42d-75b3-414b-8d52-9bd3628b6b76","resolution":{"observed_at":"2026-08-10T17:21:04.430791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.213003Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation, 2024","venue":null,"work_id":"c3e148bb-b9e7-4b02-9a65-abf1f22a9305","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.435876Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:7304bd9a6c09c3e5c144ef02469b9b208a610ccb5f86277020b4508285f4cce3","observation_id":"9534376e-6416-4d9e-a1db-112c70e201eb","resolution":{"observed_at":"2026-08-10T17:21:05.218037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.197174Z","title":"Emu: Generative pretraining in multimodality, 2024","venue":null,"work_id":"331df43e-30e0-4daa-8d89-56a86ef09c27","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.440563Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:28a06a065018c0cde58886446bd1890567303e73dd1368256efe8483ad73e403","observation_id":"f1b697cc-4b73-4fd7-a086-d4ba312325a1","resolution":{"observed_at":"2026-08-10T17:21:05.202213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.180634Z","title":"Hart: Efficient visual generation with hybrid autoregressive transformer","venue":null,"work_id":"3276affe-7411-45d0-8692-fb8561befa22","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.444991Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:1f490ef3af4f9f0f618e4a6c1f30fbb7e9d1afa47edcd73e75ea5feaa0de5118","observation_id":"4284d52c-fe79-427f-9813-d5d51dfcddac","resolution":{"observed_at":"2026-08-10T17:21:05.185718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.164079Z","title":"Any-to-any generation via composable diffusion, 2023","venue":null,"work_id":"08789a19-1925-4cce-806d-f47e48528840","year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.449643Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:1100148c240fb242fea6995eee175bcdb13a829c68bbb23f3e221294bda75e22","observation_id":"33cd3e92-1192-4ad6-ac2f-e43e1264750d","resolution":{"observed_at":"2026-08-10T17:21:05.169008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-10T17:21:04.454118Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.454118Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:43872af94e4ffffcfd62a706e17513c4eb19be0bf06b9ebd92b8006e94f6c247","observation_id":"b7482b26-fc8c-480e-8e16-18dabf8f7f66","resolution":{"observed_at":"2026-08-10T17:21:04.454118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.148463Z","title":"Chameleon: Mixed-modal early-fusion foundation models, 2024","venue":null,"work_id":"e95a339b-07f0-4bff-861a-43d43bafe7fc","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.459369Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:d1eca01de07bc3f6ccebb3e6df018dc5a3842b82fffb726e1b3a3d55e85bd20f","observation_id":"b09cea6d-cd21-4e3a-b502-604c4227c340","resolution":{"observed_at":"2026-08-10T17:21:05.153496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.130561Z","title":"Gemini: A family of highly capable multi- modal models, 2024","venue":null,"work_id":"d55ec98b-0897-446f-8886-0e13b60a8d01","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.464229Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:50d3be5c9067825bc7e72ed01e36bf34a1249f40dfaee5ad5c99f24ebdbcee90","observation_id":"0eb9c253-a750-4dfe-8ce0-e714ac4f1155","resolution":{"observed_at":"2026-08-10T17:21:05.136580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.112191Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":"c393f9cf-ae2d-4a6e-9235-d694c0aa9de9","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.468923Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:320b2bc410994f91b95c80ae765dee443676f15b9717426e9bcd34107946bda9","observation_id":"c46ec641-224c-4622-a994-0dbfbee052f9","resolution":{"observed_at":"2026-08-10T17:21:05.117973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T17:21:04.473439Z","title":"Lacroix, Baptiste R., Naman Goyal, Eric Hambro, Faisal Azhar, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.473439Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:5e3f090c088d574e5e82d9ba6caeaadaa8adde4ead9d2972be725f8c35e97025","observation_id":"afa5e832-8fdd-474a-b72b-2ffe528815ed","resolution":{"observed_at":"2026-08-10T17:21:04.473439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T17:21:04.477802Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.477802Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:a2ee5df6e30707672b3299804b433063412f2aa1f0d6237869d760b7f0358280","observation_id":"575930a0-480b-4283-8db9-9c67ae203c2f","resolution":{"observed_at":"2026-08-10T17:21:04.477802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-10T17:21:04.482440Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.482440Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:e5b1b11fd9acba48175a2663290d30d3529ec354d55165533ac7402fc8d7f72e","observation_id":"223ddf3d-9771-4eec-aaca-9a5db3eccc20","resolution":{"observed_at":"2026-08-10T17:21:04.482440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.093209Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and genera- tion, 2024","venue":null,"work_id":"fd459f6a-a8d8-408c-bf93-52778a730e8c","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.487152Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:b2229718c76133b07e74a6bf358ca164ae986f2bf23dcf96b3f2ff6cb13dc643","observation_id":"ccf4fa23-a0f7-4caf-98be-6f1a4a9cc6b0","resolution":{"observed_at":"2026-08-10T17:21:05.099022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-19T20:11:01.764633Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-10T17:21:04.491869Z","title":"Liq- uid: Language models are scalable multi-modal generators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.491869Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:ad4a70d137831574d00c20df28da9e1d4345d843fdd26d897128ba489566723d","observation_id":"07804346-6d60-4570-81a4-816bb00d4b59","resolution":{"observed_at":"2026-08-10T17:21:04.491869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-17T09:50:53.260956Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-10T17:21:04.497553Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.497553Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:599d7d1d87fd132c2f92ba62b3be4368f1103e6806a5bf6401cf57a68d31079b","observation_id":"2919fe17-42dd-4e1d-a91c-f17cf84ad08b","resolution":{"observed_at":"2026-08-10T17:21:04.497553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-08-18T17:34:44.890427Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-10T17:21:04.503740Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.503740Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:a84c42ba016cb4cdd1f0a6fb046c08f9b83fe7aa5eaceb4ac0683d46c190df90","observation_id":"1b285d06-f445-495c-965d-fcd465fe69d6","resolution":{"observed_at":"2026-08-10T17:21:04.503740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.076423Z","title":"Show-o: One single transformer to unify multimodal understanding and generation, 2024","venue":null,"work_id":"ca0f8fef-a61d-4952-86b0-43a09ca5e681","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.508878Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:e9ed393b2461128ce78deedd4f527057e8b8f1c2f647f58a5a7cb342c8c7fb78","observation_id":"4acae73c-0414-4deb-bcfe-5f87fece7fba","resolution":{"observed_at":"2026-08-10T17:21:05.081298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.060445Z","title":"X-vila: Cross-modality align- ment for large language model, 2024","venue":null,"work_id":"5162f09a-fc00-4403-aaa9-77dd3f78fa86","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.513698Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:bdcf042c6fa70adb35fb3e98327d115886b8e7ce9de6b80c9fb6563962cbad05","observation_id":"3192d077-b9ca-406b-99f0-7d193a3837d9","resolution":{"observed_at":"2026-08-10T17:21:05.065607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-08-17T11:19:59.774979Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-08-10T17:21:04.518425Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.518425Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:7c2181971486e199ed6e540cd672058c9d862c8e6de38a3710ed8f382ee7f0c4","observation_id":"7f74507e-3009-4f7d-be6e-dc1309ffbd58","resolution":{"observed_at":"2026-08-10T17:21:04.518425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.043305Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"a3894b35-c74d-4dd4-ab7a-372a63b11496","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.523483Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:95c3365d2e50de3a4be76bc9e12a5e3b97312b0f20db3e5f994d9bc4951f1836","observation_id":"2c9753cf-45c7-4c39-bbb5-5c5c724de964","resolution":{"observed_at":"2026-08-10T17:21:05.048940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16045","last_updated":"2024-12-11T02:46:29Z","snapshot_observed_at":"2026-08-18T12:54:07.136498Z","submitted_at":"2023-10-24T17:58:07Z","title":"Woodpecker: Hallucination Correction for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16045","snapshot_observed_at":"2026-08-10T17:21:04.528220Z","title":"Woodpecker: Hallucination correction for multi- modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.528220Z"},"links":{"cited_paper":"/paper/2310.16045","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:b1eecbdcc247d321d326bcabd941e9ea7f03b5edc25ada1216b1294cfb802bd0","observation_id":"a86774a0-f579-4365-b430-b82d493d0519","resolution":{"observed_at":"2026-08-10T17:21:04.528220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.533079Z","title":"Scaling autoregressive models for content-rich text-to-image generation, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.533079Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:1745dc680a388e0e515f2fd7ccb1ec9d83e923605acd93624554da3be0e56959","observation_id":"b0a5f092-939f-4f8f-904d-ecfc93be4057","resolution":{"observed_at":"2026-08-10T17:21:04.533079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.008845Z","title":"Mmmu: A massive multi-discipline multimodal understand- ing and reasoning benchmark for expert agi, 2024","venue":null,"work_id":"c53221ba-7915-4e5c-a743-739ce18d2209","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.537979Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:bc290769f7d8dffb9b5aa19fff2a9883f0f943d34117f3056562009f16103969","observation_id":"8e66f95f-5fb4-4782-b7b8-9f09cc37c952","resolution":{"observed_at":"2026-08-10T17:21:05.016487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.542716Z","title":"Lmms- eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.542716Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:ae79d54c6344b4652a8ab589d9e82a1c7ddaa66e202fef5a89bbdc3550dcb66e","observation_id":"86b1424d-1762-47fc-8a10-54433d2ceff1","resolution":{"observed_at":"2026-08-10T17:21:04.542716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.977310Z","title":"Var-clip: Text-to-image generator with visual auto-regressive modeling, 2024","venue":null,"work_id":"32d66299-cb40-435c-afd1-99d7a5493bf3","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.547305Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:721d213c1b341e2994db6abfe0100ad2c8d16bb741d84e0f0dd1f424d83257c1","observation_id":"016c92f5-1ba3-4d55-b361-2ff766f765d6","resolution":{"observed_at":"2026-08-10T17:21:04.983358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":46},"total_outbound_references":104},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 100 of 104 outbound references and 22 inbound Pith citation observations for arXiv:2501.12327."}