{"as_of":"2026-08-17T19:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:581e630e6b5718d1c0d16f07023791ca779f7bab2f4839806f68d33b35a35be3","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:35:43.681356Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:16:36.507549Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T05:38:05.420263Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"cited_work":{"arxiv_id":"2504.17789","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.17789","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token-shuffle: Towards high-resolution image generation with autoregressive models","venue":null,"work_id":"5c5cc6b4-7a61-4382-a740-74301728a987","year":2025},"citing_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-08-16T09:34:56.272667Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T23:34:26.878354Z"},"links":{"cited_paper":"/paper/2504.17789","citing_paper":"/paper/2505.09568"},"observation_digest":"sha256:20d1e138c7468aee97490cb79fe0be3eedc0cd8f5c502f797885c1731c9b25f5","observation_id":"ddfc14a4-8183-44ba-926e-89e36f2c7c4d","resolution":{"observed_at":"2026-05-11T23:34:26.995036Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17789","snapshot_observed_at":"2026-08-15T20:16:36.507549Z","title":"Token-shuffle: Towards high-resolution image generation with autoregressive models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.507549Z"},"links":{"cited_paper":"/paper/2504.17789","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:7d31d52a9608c5577373978d02436cea92e9223bf7d4579bf40e766ad90c1ada","observation_id":"f83de64b-06dd-478d-bd12-388f9ba8b9ae","resolution":{"observed_at":"2026-08-15T20:16:36.507549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17789","snapshot_observed_at":"2026-08-15T18:46:10.751576Z","title":"Token-shuffle: Towards high-resolution image generation with autoregressive models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18898","last_updated":"2025-06-23T17:59:14Z","snapshot_observed_at":"2026-08-15T23:43:47.561047Z","submitted_at":"2025-06-23T17:59:14Z","title":"Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:10.751576Z"},"links":{"cited_paper":"/paper/2504.17789","citing_paper":"/paper/2506.18898"},"observation_digest":"sha256:adde2f8373800ba7aa55632bfebd039125e848a16e432ca3d88f2e440d4de19d","observation_id":"2d6a1d00-a672-4445-9d96-00aea3c77fb2","resolution":{"observed_at":"2026-08-15T18:46:10.751576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"cited_work":{"arxiv_id":"2504.17789","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.17789","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token-shuffle: Towards high-resolution image generation with autoregressive models","venue":null,"work_id":"5c5cc6b4-7a61-4382-a740-74301728a987","year":2025},"citing_paper":{"arxiv_id":"2605.07230","last_updated":"2026-05-08T04:32:17Z","snapshot_observed_at":"2026-08-14T14:15:12.892178Z","submitted_at":"2026-05-08T04:32:17Z","title":"CASCADE: Context-Aware Relaxation for Speculative Image Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T02:08:27.374066Z"},"links":{"cited_paper":"/paper/2504.17789","citing_paper":"/paper/2605.07230"},"observation_digest":"sha256:1f932471bde884b89f450c8a55a59e986a26a546ff2e24e6d4bb740698cd9561","observation_id":"67bd2455-c0da-4b8b-81aa-20e1d767cd27","resolution":{"observed_at":"2026-05-11T03:55:54.975543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"cited_work":{"arxiv_id":"2504.17789","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.17789","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token-shuffle: Towards high-resolution image generation with autoregressive models","venue":null,"work_id":"5c5cc6b4-7a61-4382-a740-74301728a987","year":2025},"citing_paper":{"arxiv_id":"2605.19227","last_updated":"2026-05-19T00:55:18Z","snapshot_observed_at":"2026-08-15T16:49:27.264722Z","submitted_at":"2026-05-19T00:55:18Z","title":"Token by Token, Compromised: Backdoor Vulnerabilities in Unified Autoregressive Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:46.236860Z"},"links":{"cited_paper":"/paper/2504.17789","citing_paper":"/paper/2605.19227"},"observation_digest":"sha256:50b00c7df256ec68a19885c60502f1b336b01a8678383a7e0b998aa2651b6905","observation_id":"f1b0cdb9-be2a-4455-98ab-cd845258c5ec","resolution":{"observed_at":"2026-05-20T05:38:05.424225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.17789/citation-record","integrity":"/paper/2504.17789/integrity","json":"/paper/2504.17789/citation-record.json","paper":"/paper/2504.17789"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2201.07520","last_updated":"2022-01-19T10:45:38Z","snapshot_observed_at":"2026-08-16T17:27:23.345212Z","submitted_at":"2022-01-19T10:45:38Z","title":"CM3: A Causal Masked Multimodal Model of the Internet","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.07520","snapshot_observed_at":"2026-08-16T10:35:43.522386Z","title":"Cm3: A causal masked multimodal model of the internet.arXiv preprint arXiv:2201.07520,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.522386Z"},"links":{"cited_paper":"/paper/2201.07520","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:fb67f2b29196e11e25f3f25c1e39c7f3faa9cf04dfaaea3675b8e1f3fc8ed859","observation_id":"1ca73cd6-1b25-4f5e-9ae8-cc6468ef83ad","resolution":{"observed_at":"2026-08-16T10:35:43.522386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:35:44.066664Z","title":"The prompts are from GenEval Ghosh et al","venue":null,"work_id":"1286e7b0-44cc-460f-95c8-b17192458090","year":2024},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.677800Z"},"links":{"citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:91dc4c12e62da4d0cf44ceffffe0d13c308fcccc80c47c42863f52378c4cbc83","observation_id":"c149b152-6393-4563-bbc2-688bd0b34785","resolution":{"observed_at":"2026-08-16T10:35:44.070231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-16T15:18:27.962961Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-16T10:35:43.535627Z","title":"Longnet: Scaling transformers to 1,000,000,000 tokens.arXiv preprint arXiv:2307.02486,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.535627Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:f436731780c92ea40f414b765b65e8365eb89e6447d5948bcf163fc9b672b4e2","observation_id":"cc870101-39ca-4938-8ed4-af6bc5e9af86","resolution":{"observed_at":"2026-08-16T10:35:43.535627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T10:35:43.539858Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.539858Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:2a8656206067c14156c8c93eba2510973d9e8afba4d06aa057c2770ca68b11b5","observation_id":"c10a3c53-c37b-4281-bed4-18596091c2f5","resolution":{"observed_at":"2026-08-16T10:35:43.539858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13863","last_updated":"2024-10-17T17:59:59Z","snapshot_observed_at":"2026-08-16T13:08:17.144750Z","submitted_at":"2024-10-17T17:59:59Z","title":"Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13863","snapshot_observed_at":"2026-08-16T10:35:43.543974Z","title":"Yuying Ge, Sijie Zhao, Jinguo Zhu, Yixiao Ge, Kun Yi, Lin Song, Chen Li, Xiaohan Ding, and Ying Shan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.543974Z"},"links":{"cited_paper":"/paper/2410.13863","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:03b1774dc5d0640ea3efe5ec542e279226f04196938afba8dc08cf73c8c02f83","observation_id":"9aa4903c-6460-4750-8b37-1d9ae703600e","resolution":{"observed_at":"2026-08-16T10:35:43.543974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-16T14:42:19.011451Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-16T10:35:43.547967Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.547967Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:1781bfdf9a9addf115108fd8d1937fe0fcb5c54d8bd8435f14d070f5c82735cd","observation_id":"8900b32c-204d-4d5e-8640-e23bed42f665","resolution":{"observed_at":"2026-08-16T10:35:43.547967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19737","last_updated":"2024-04-30T17:33:57Z","snapshot_observed_at":"2026-08-16T23:36:44.216328Z","submitted_at":"2024-04-30T17:33:57Z","title":"Better & Faster Large Language Models via Multi-token Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19737","snapshot_observed_at":"2026-08-16T10:35:43.551668Z","title":"Better & faster large language models via multi-token prediction.arXiv preprint arXiv:2404.19737,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.551668Z"},"links":{"cited_paper":"/paper/2404.19737","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:0c9bd5ca41213a82e0ad80d58863be976ceaaa96cbd9b722252f35402507eb62","observation_id":"9f978dbc-ff12-40ca-bfd1-fd04a7b45d3c","resolution":{"observed_at":"2026-08-16T10:35:43.551668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-16T10:35:43.555452Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.555452Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:cb99d3faf94dfa206317557fa4b94585be43a54948cda9a0a632125f6a7254f4","observation_id":"6623d2ad-790a-4ddb-9bd3-f5785bd26d7d","resolution":{"observed_at":"2026-08-16T10:35:43.555452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18822","last_updated":"2025-03-10T17:56:21Z","snapshot_observed_at":"2026-08-16T14:38:42.658074Z","submitted_at":"2023-11-30T18:58:17Z","title":"ElasticDiffusion: Training-free Arbitrary Size Image Generation through Global-Local Content Separation","version":3},"cited_work":{"arxiv_id":"2311.18822","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.18822","snapshot_observed_at":"2026-08-16T10:35:43.950457Z","title":"ElasticDiffusion: Training-free Arbitrary Size Image Generation through Global-Local Content Separation","venue":"cs.CV","work_id":"cd455c5e-eef0-4c67-9193-ff0855a60642","year":2023},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.559396Z"},"links":{"cited_paper":"/paper/2311.18822","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:6f34ed14e5b74ebc60fa3ff3d7aef4f1a91555af9c05d4700b76f42f57d2a33d","observation_id":"f3cd3569-b761-44e8-b2d6-dede0611d1d4","resolution":{"observed_at":"2026-08-16T10:35:43.956562Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-16T10:35:43.563496Z","title":"Clipscore: A reference-free evaluation metric for image captioning.arXiv preprint arXiv:2104.08718,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.563496Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:80adc1a16f564a1b47bdffa6a19b50f9907f2519530713daf7b6fb4a13a1b4cb","observation_id":"54348ea7-d209-443f-a712-16d66901f4ce","resolution":{"observed_at":"2026-08-16T10:35:43.563496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:35:44.115060Z","title":"However, as training progresses, the model consistently generates visual tokens up to the <|end_of_image|> token, resulting in complete images","venue":null,"work_id":"89f44c95-a102-4683-90b9-b616ab644746","year":2023},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.662683Z"},"links":{"citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:f227ed1cf9386618a726209595038b859a0a6f6467be3786fcfc4b90da34eeb6","observation_id":"333e5d38-ab10-44e6-8445-b990bf06ea4a","resolution":{"observed_at":"2026-08-16T10:35:44.119612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13743","last_updated":"2024-11-03T20:22:32Z","snapshot_observed_at":"2026-08-16T13:41:21.785733Z","submitted_at":"2024-06-19T18:00:07Z","title":"GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13743","snapshot_observed_at":"2026-08-16T10:35:43.571101Z","title":"Genai-bench: Evaluating and improving compositional text-to-visual generation.arXiv preprint arXiv:2406.13743, 2024a","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.571101Z"},"links":{"cited_paper":"/paper/2406.13743","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:d4d43c586d60765d7eefdba38f4db3ad00ba58673c8c6a59bba0bac3b1a40a68","observation_id":"9b2c457f-ebf4-44f0-8d14-8898f957bb99","resolution":{"observed_at":"2026-08-16T10:35:43.571101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-16T10:35:43.578657Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.578657Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:ce136853d5c2cef0bfec8da9de20daff18c395cc176f1ee8889141d7b8650f61","observation_id":"83e69c32-228e-4c25-9b0c-6a8ff7285e45","resolution":{"observed_at":"2026-08-16T10:35:43.578657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-16T13:20:41.485941Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-16T10:35:43.586438Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual generation.arXiv preprint arXiv:2409.04410,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.586438Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:43f6f158e6edc554b2aa2a018069b5703007cf3ce8c0e1032660bb7d3227046e","observation_id":"2eb2c979-3db1-4656-a2c5-e564d5db7e1a","resolution":{"observed_at":"2026-08-16T10:35:43.586438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10797","last_updated":"2025-02-19T06:00:55Z","snapshot_observed_at":"2026-08-16T13:42:37.639247Z","submitted_at":"2024-06-16T03:45:45Z","title":"STAR: Scale-wise Text-conditioned AutoRegressive image generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10797","snapshot_observed_at":"2026-08-16T10:35:43.590580Z","title":"Star: Scale-wise text-to-image generation via auto-regressive representations.arXiv preprint arXiv:2406.10797,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.590580Z"},"links":{"cited_paper":"/paper/2406.10797","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:63bf81138af7f8b1cb57729530506af4610084a4c0e10d21e81d79d1b4d884c5","observation_id":"be21d35b-382a-4deb-8548-5611c7f3fb69","resolution":{"observed_at":"2026-08-16T10:35:43.590580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-16T10:35:43.594364Z","title":"Language models are few-shot learners.arXiv preprint arXiv:2005.14165, 1,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.594364Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:ad1bf6d7cac393fa01397c93fc2e20fc2662f4aa8dc466528b3c71c1138e178f","observation_id":"9450c0e9-bcc2-4e36-9386-beeb7c1f5f27","resolution":{"observed_at":"2026-08-16T10:35:43.594364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-08-17T17:58:38.402665Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-16T10:35:43.602677Z","title":"Rwkv: Reinventing rnns for the transformer era.arXiv preprint arXiv:2305.13048,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.602677Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:bebb5dc786c1a9d2dad1c6af92e31a15b99a403e205afb066350f9528aa656b3","observation_id":"6ef786a7-24b5-4600-a3db-3490cf4a0bc4","resolution":{"observed_at":"2026-08-16T10:35:43.602677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-16T10:35:43.606503Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.606503Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:99a4e927c54c21edd8b392b7b2206a42196b2ff8857a68f136bab22663dbe08a","observation_id":"5472723f-208f-4d0a-972b-078bc884c873","resolution":{"observed_at":"2026-08-16T10:35:43.606503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-17T10:09:03.767186Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-16T10:35:43.610369Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.610369Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:a3cfc388c5d4a500473d3778642d817925aa18337eba50e3d68ec53f7e2e2afb","observation_id":"9e11f2f2-2c61-4866-83f9-421a4f324ce6","resolution":{"observed_at":"2026-08-16T10:35:43.610369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09626","last_updated":"2025-07-11T09:08:46Z","snapshot_observed_at":"2026-08-14T10:15:52.922358Z","submitted_at":"2024-12-12T18:59:59Z","title":"FreeScale: Unleashing the Resolution of Diffusion Models via Tuning-Free Scale Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09626","snapshot_observed_at":"2026-08-16T10:35:43.614084Z","title":"Freescale: Unleashing the resolution of diffusion models via tuning-free scale fusion.arXiv preprint arXiv:2412.09626,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.614084Z"},"links":{"cited_paper":"/paper/2412.09626","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:4e1cf6821dfbbaaf3b8052a8ae18ceeddfe35b879e3fe83008c8a8641b2accfe","observation_id":"754f8313-bc20-4da7-8671-ad2d9808c311","resolution":{"observed_at":"2026-08-16T10:35:43.614084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02158","last_updated":"2024-07-04T08:11:19Z","snapshot_observed_at":"2026-08-16T13:37:48.106145Z","submitted_at":"2024-07-02T11:02:19Z","title":"UltraPixel: Advancing Ultra-High-Resolution Image Synthesis to New Peaks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02158","snapshot_observed_at":"2026-08-16T10:35:43.621950Z","title":"Ultrapixel: Advancing ultra-high-resolution image synthesis to new peaks.arXiv preprint arXiv:2407.02158,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.621950Z"},"links":{"cited_paper":"/paper/2407.02158","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:9d8758e8745fd05d438fab8b78008a1ace85ce2b7a3e4871082e16821d50938e","observation_id":"ada7ff7a-37da-4599-98c5-1c7e6ebdfadb","resolution":{"observed_at":"2026-08-16T10:35:43.621950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-08-12T01:14:44.484432Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-16T10:35:43.625389Z","title":"Progressive distillation for fast sampling of diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.625389Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:0b18dbcb85f18162fa2a3d8c83ca464992ca8ac6c8699e1d74595c3765b6c2de","observation_id":"dd8a5f0f-1858-401b-9caf-5ff1e0f2437e","resolution":{"observed_at":"2026-08-16T10:35:43.625389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-08-16T14:03:52.109479Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-16T10:35:43.632926Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.arXiv preprint arXiv:2404.02905,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.632926Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:181ebdd81ee33774ef6eea55f2b30ea90174d8bfdf1c44333977dded1ccfc7b7","observation_id":"caeb0836-18b2-41f7-bced-7d317f10d1e7","resolution":{"observed_at":"2026-08-16T10:35:43.632926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T10:35:43.636462Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.636462Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:43d5950d8685718f8fe12c667a90afccd312e0780ebda3b71c713ff7b9248e74","observation_id":"3279a8ab-c99b-4ee0-8c9c-b3b63e51e0c3","resolution":{"observed_at":"2026-08-16T10:35:43.636462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13040","last_updated":"2024-12-04T14:38:11Z","snapshot_observed_at":"2026-08-16T13:59:23.849166Z","submitted_at":"2024-04-19T17:53:43Z","title":"Analysis of Classifier-Free Guidance Weight Schedulers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13040","snapshot_observed_at":"2026-08-16T10:35:43.640076Z","title":"Analysis of classifier-free guidance weight schedulers.arXiv preprint arXiv:2404.13040, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.640076Z"},"links":{"cited_paper":"/paper/2404.13040","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:96c1584f92efa4c71056963ce2223920043583e74d5f9a37459238f5c7d044bd","observation_id":"298a6227-b9ba-4455-b56e-cc376be95a1f","resolution":{"observed_at":"2026-08-16T10:35:43.640076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-08-16T01:17:28.297637Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-16T10:35:43.643617Z","title":"Sana: Efficient high-resolution image synthesis with linear diffusion transformers.arXiv preprint arXiv:2410.10629, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.643617Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:5abcd243955c8a21290e8f0c53c2739e07938ecfedb43a80624f3538fee4892c","observation_id":"63902960-c22b-4e0f-a904-e5558fa8c2fb","resolution":{"observed_at":"2026-08-16T10:35:43.643617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-16T10:35:43.647371Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.647371Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:4110efd3375d1d7620c8c9a98819817a56d862d5b9fd4214bf8b4ebd9abd1c71","observation_id":"3a345d76-c8ed-497a-ad95-5881eff7fdb4","resolution":{"observed_at":"2026-08-16T10:35:43.647371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-16T10:35:43.651456Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.651456Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:c7d0ce9bf2148f1c98e9eff64d87150fb04a9886a77bcbd0655101e1d0ee122a","observation_id":"b28cc293-e3e1-4135-acde-bd4b37de9d76","resolution":{"observed_at":"2026-08-16T10:35:43.651456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:35:44.138493Z","title":"We provide detailed implementations in Sec","venue":null,"work_id":"0dd87023-f381-4a88-bd16-456066b8b3dd","year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.655402Z"},"links":{"citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:62cfd2f4f1461675c0dfb371abd907ed035b786428e7f127a4d5a48aa98a53a2","observation_id":"b7c7f62a-eb59-47f3-8052-640d298de74e","resolution":{"observed_at":"2026-08-16T10:35:44.142249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:35:44.089292Z","title":null,"venue":null,"work_id":"dd58cf1e-264f-4e87-b1e9-09a783dfa909","year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.670656Z"},"links":{"citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:b5415e3740c6963909371a3ed54776f6709c42534eea6120fbddc89593131de8","observation_id":"acb00189-344d-437c-8fe8-fc4dd81ff1c6","resolution":{"observed_at":"2026-08-16T10:35:44.092991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:35:44.077923Z","title":"All images were generated with a shuffle window size of 2, half-linear CFG-scheduler with a scale of 7.5, as stated previously","venue":null,"work_id":"697171d4-bfc8-42a5-a752-abdde2c193b9","year":2024},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.674148Z"},"links":{"citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:cdde9fa9d8a189dba405625a8ad7eeb695ae7d24575468ffef0fd9c315d57df8","observation_id":"bfe3e18d-2f05-4554-a287-ec0dcc526a1f","resolution":{"observed_at":"2026-08-16T10:35:44.081907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:35:44.055900Z","title":"The prompts are from our internal evaluation prompts","venue":null,"work_id":"39134f62-bc27-44ce-8b6c-c8bbc7ab7a29","year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.681356Z"},"links":{"citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:1d473e61eb200d83a15419ce4ac6dd86264d5f1a7767c892bc0ed8fa966ee14d","observation_id":"0becff87-95b6-4245-9b9e-2785210f7f91","resolution":{"observed_at":"2026-08-16T10:35:44.059503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:35:44.100357Z","title":"The 16× VQGAN model is taken from the previous LlamaGen T2I checkpoint, while the8×VQGAN is derived from our internal checkpoint","venue":null,"work_id":"7745fe9e-026d-4c86-b11d-ca1b0a3b018c","year":2014},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":512,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.666582Z"},"links":{"citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:e2caa97051b37b8a6b8741a0a9c7c3d5563a986b9b1475cbd2581ebd692a3840","observation_id":"1ec5193d-c66c-48e0-8a2b-17358305aef0","resolution":{"observed_at":"2026-08-16T10:35:44.104320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-08-16T14:04:34.158327Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-16T10:35:43.574993Z","title":"Evaluating text-to-visual generation with image-to-text generation.arXiv preprint arXiv:2404.01291,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.574993Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:e41e1cdd12030e2da9e84f1296474fc6a26b04c46bc209750c3219e53ad92c35","observation_id":"ff7c0184-246c-4eef-bec4-fa1698096961","resolution":{"observed_at":"2026-08-16T10:35:43.574993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-16T10:35:43.629300Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020a","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.629300Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:71106cf96748e3a8b1b79979d62af1bc5c218c4eea1520e8a16cff88c5b27436","observation_id":"deeb0600-7cfa-4036-b903-379ff701a0dd","resolution":{"observed_at":"2026-08-16T10:35:43.629300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-16T10:35:43.567364Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.567364Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:95f6e34b6449e00e8d65b42624dc2436a2ad5abbaccf3b592540586e0a115215","observation_id":"d042b77f-7b4b-4596-8352-793ef75badd4","resolution":{"observed_at":"2026-08-16T10:35:43.567364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-14T06:07:59.988146Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-16T10:35:43.598602Z","title":"Transfer between modalities with metaqueries.arXiv preprint arXiv:2504.06256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.598602Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:c1a913c8b3ad627e3a931276df1aa7d2869afabe2df9e704031814c5b8fa7912","observation_id":"e5aae8a8-58c6-44a4-8bbc-33d2e0ba33c7","resolution":{"observed_at":"2026-08-16T10:35:43.598602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-16T10:35:43.617674Z","title":"Hierarchical text-conditional image generation with clip latents.arXiv preprint arXiv:2204.06125, 1(2):3,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.617674Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:7be26b2345f289203e1cbcec650c257e6ec029dadca354b3bdb0b902127afd8f","observation_id":"58a264b8-fb4a-4f2c-9bb9-f7e10f675ba8","resolution":{"observed_at":"2026-08-16T10:35:43.617674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-16T13:28:23.779681Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-16T10:35:43.582377Z","title":"Lumina-mgpt: Illu- minate flexible photorealistic text-to-image generation with multimodal generative pretraining.arXiv preprint arXiv:2408.02657,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.582377Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:636386a61beb79511775f42258038388411897eb704db67e002e45cc2812df39","observation_id":"5e40635f-87ab-4833-a682-775729566e80","resolution":{"observed_at":"2026-08-16T10:35:43.582377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-08-16T14:11:52.899972Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-16T10:35:43.527746Z","title":"Pixart-/sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.527746Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:c8565aa4259a6325a691649edda0cd5acf105c13eae6cab2d19d806532646793","observation_id":"72683635-b1fb-4e4e-ad7f-a94efe1cd5a9","resolution":{"observed_at":"2026-08-16T10:35:43.527746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15807","last_updated":"2023-09-27T17:30:19Z","snapshot_observed_at":"2026-08-16T14:57:07.361681Z","submitted_at":"2023-09-27T17:30:19Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15807","snapshot_observed_at":"2026-08-16T10:35:43.531675Z","title":"Emu: Enhancing image generation models using photogenic needles in a haystack","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.531675Z"},"links":{"cited_paper":"/paper/2309.15807","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:89304038a5d3e0ec298f070bfa39e05fad26590834db6d3bf8108bb1148dfe65","observation_id":"ffde7b45-3d3e-48e4-ac22-297dcb7e982f","resolution":{"observed_at":"2026-08-16T10:35:43.531675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:35:44.126968Z","title":"To investigate the cause of unstable training, we analyze the training process in detail","venue":null,"work_id":"b06e8cfa-f94b-496a-9cdd-cfc46895babf","year":2024},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":2048,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.658785Z"},"links":{"citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:6baacac1bdfdaf8d813545177692aaa04a0972920ade05fe8119eb53077f39cc","observation_id":"19982be7-677c-48c2-916f-4fa7e113ade7","resolution":{"observed_at":"2026-08-16T10:35:44.130810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":1,"verified_fuzzy":7},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 5 inbound Pith citation observations for arXiv:2504.17789."}