{"as_of":"2026-08-14T10:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bdd698041d028cbd5c9acf689c3e7c3da654d3dd1261fe7debe7215a60fd6b8c","coverage":[{"denominator":137,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:55:42.363118Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.14808/citation-record","integrity":"/paper/2411.14808/integrity","json":"/paper/2411.14808/citation-record.json","paper":"/paper/2411.14808"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T14:55:41.595842Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.595842Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:2932c6ab8834c09af46c631e39ef814224bd091112adfe6833aff0f6f464b320","observation_id":"e86bbf5c-659a-45af-9892-d3d006f66bf2","resolution":{"observed_at":"2026-08-12T14:55:41.595842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.600514Z","title":"A window with raindrops trickling down, overlooking a blurry city","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.600514Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:9a1534c1283e41ba38334c6166212d87767ce050208727988e57dee34c347284","observation_id":"36c78d02-b30e-4b77-8b99-d1e2e4921d57","resolution":{"observed_at":"2026-08-12T14:55:41.600514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08797","last_updated":"2025-10-09T00:43:44Z","snapshot_observed_at":"2026-07-06T15:03:52.079498Z","submitted_at":"2023-03-15T17:43:42Z","title":"Stochastic Interpolants: A Unifying Framework for Flows and Diffusions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08797","snapshot_observed_at":"2026-08-12T14:55:41.604928Z","title":"Stochastic interpolants: A unifying framework for flows and diffusions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.604928Z"},"links":{"cited_paper":"/paper/2303.08797","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:9591a5721e2903d1de331657125c460ca80830f8e413a95d728ae195230a8633","observation_id":"fbd11f71-a9fe-416f-8e13-5582dbed13c3","resolution":{"observed_at":"2026-08-12T14:55:41.604928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-12T14:55:41.609639Z","title":"Palm 2 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.609639Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:bb2ae9fc69ac570e3183688108a4522ccf6ddcfde2f22fa1376a5d9e1d85fc68","observation_id":"6f2730ed-997d-449d-b13d-cead22f0f1cb","resolution":{"observed_at":"2026-08-12T14:55:41.609639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T14:55:41.614007Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.614007Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:6f065c082b78c387ffc1c9a3a2815c1c3c76980afe9501cfdb27a855d2450d44","observation_id":"733d3135-d48b-4284-a61b-d1ec8c9b7038","resolution":{"observed_at":"2026-08-12T14:55:41.614007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.618699Z","title":"Layout control by relative positional offset b","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.618699Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:7de4515b9dc5eecd964f1e0583954f6202dc9fefa817f58699f40e8b7ba15b2e","observation_id":"63b347ca-1b64-432e-9fdd-2d8d81eb5b1b","resolution":{"observed_at":"2026-08-12T14:55:41.618699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.06503","last_updated":"2022-05-03T08:05:54Z","snapshot_observed_at":"2026-08-13T16:58:03.736450Z","submitted_at":"2022-01-17T16:28:12Z","title":"Analytic-DPM: an Analytic Estimate of the Optimal Reverse Variance in Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.06503","snapshot_observed_at":"2026-08-12T14:55:41.622653Z","title":"Analytic- dpm: an analytic estimate of the optimal reverse vari- ance in diffusion probabilistic models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.622653Z"},"links":{"cited_paper":"/paper/2201.06503","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:e5ea04e6e87c640a5df9d37843d627aeefc470283027fab07a2199c0897de0e7","observation_id":"8ba0d1be-cd99-4371-883b-613c11083623","resolution":{"observed_at":"2026-08-12T14:55:41.622653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.627308Z","title":"All are worth words: A vit backbone for diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.627308Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:4cfb3f1dfab92751215174ede457468ba2b451eae2646234ce1dd3c77e10e79d","observation_id":"5c7df0cb-1da1-4c9c-b3ae-3ca5368a4a87","resolution":{"observed_at":"2026-08-12T14:55:41.627308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-13T00:13:12.479004Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-12T14:55:41.631468Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.631468Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:8b0ae25e38a433de7ada540a971945c756c2e85d5896454dc5b7ff63c9b88638","observation_id":"d83fc5a1-b65c-4edc-b103-26e11cd5cd2f","resolution":{"observed_at":"2026-08-12T14:55:41.631468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-08-13T16:48:25.566954Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-12T14:55:41.636000Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.636000Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:bb4c6cabd217c8bd5a3016e2173affdb51c865d505352e0a9b0d79cb16259a56","observation_id":"68c33c2b-2b2e-4da4-8653-9487330c8c10","resolution":{"observed_at":"2026-08-12T14:55:41.636000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-13T04:36:44.594755Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-12T14:55:41.640035Z","title":"Lumiere: A space- time diffusion model for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.640035Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:0a2600913c7cf0ad0433756b23590d68e74b9139dd484dc60f29918ec520e3a5","observation_id":"fccd1052-9e83-4755-b61b-8e5563fdd234","resolution":{"observed_at":"2026-08-12T14:55:41.640035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.644734Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.644734Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:e4e92c380544e3ea10357c17a5c99d1dd401aa46cc50cd4e327014064ac9ecbb","observation_id":"a80c798c-485e-4546-b80d-00e02854cf87","resolution":{"observed_at":"2026-08-12T14:55:41.644734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T14:55:41.648696Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.648696Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:79f24e0dadf1123418baebafab5eae5e357503e4a34e4211dde9a2ade3cae6de","observation_id":"63de849b-7c06-4ff4-8926-169e3a8dc27f","resolution":{"observed_at":"2026-08-12T14:55:41.648696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.653484Z","title":"Align your latents: High-resolution video synthe- sis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.653484Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:0687024085b234c914f477d223f26d7eaec295b7592e605679bf4b1adfbc2269","observation_id":"561b0ad8-7ebf-4995-b073-95a1898313d6","resolution":{"observed_at":"2026-08-12T14:55:41.653484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.657660Z","title":"Brooks, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.657660Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:224292e07fa4cc4bd90bebc3f5ec73046982ceeacba037d7ee3b95364766b8d5","observation_id":"bcb9320e-472c-4ff1-ad17-1b6f7723abbc","resolution":{"observed_at":"2026-08-12T14:55:41.657660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-12T14:55:41.661652Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.661652Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:ccf8e011ac4491175580a16864052c0be08599a740a6ed5c1bb43c3bcb8057f5","observation_id":"b86ac1be-a17d-4194-acaf-6937846a4fc7","resolution":{"observed_at":"2026-08-12T14:55:41.661652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.667292Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.667292Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:646702048c4df4620e4b52e44032d2ba446fd195bffcd5bfec40a4c7e9c86036","observation_id":"ffc01eaa-85a7-410f-8097-bedc24b2c961","resolution":{"observed_at":"2026-08-12T14:55:41.667292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-13T13:10:50.058243Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-12T14:55:41.671777Z","title":"Muse: Text- to-image generation via masked generative transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.671777Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:207aaf20d24fcf2cfc76e15348436ff4299b24fad53e5264b1fda7665af8851d","observation_id":"d2503e56-de50-4299-ad80-7a716e804acb","resolution":{"observed_at":"2026-08-12T14:55:41.671777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.676078Z","title":"Bfloat16: The secret to high performance on cloud tpus, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.676078Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:2b6a6d5f79ccddeb6f8d5fdfecba5bdfc9ac3aed2d0c5c7690c6fdba01412d47","observation_id":"9f240309-bf83-45f3-be72-bdd4545240d9","resolution":{"observed_at":"2026-08-12T14:55:41.676078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03755","last_updated":"2025-02-04T04:53:18Z","snapshot_observed_at":"2026-08-12T22:32:51.773574Z","submitted_at":"2024-10-02T05:57:10Z","title":"Denoising with a Joint-Embedding Predictive Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03755","snapshot_observed_at":"2026-08-12T14:55:41.684165Z","title":"Denoising with a joint-embedding predictive architecture","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.684165Z"},"links":{"cited_paper":"/paper/2410.03755","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:817d5fa2b1280177f08ed016be19555fdfc4bd4d2544cc9fe1c5d6cf7b000104","observation_id":"dfb66dac-56dc-4fbf-b749-928f2e56722b","resolution":{"observed_at":"2026-08-12T14:55:41.684165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-12T14:55:41.690352Z","title":"Pixart- α: Fast training of diffu- sion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.690352Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:fac9e2764a7014c41ec20f5c92cccf2f5e7c187e46d3bc65175e4d86d3aba7c2","observation_id":"ccd1b0b6-e81d-4394-9c20-c61dac582042","resolution":{"observed_at":"2026-08-12T14:55:41.690352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-08-13T00:59:54.489440Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-12T14:55:41.696009Z","title":"Pixart- σ: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.696009Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:573f277e1a4c9cbc786b47b3871a6de92ff2b1a46f52efd6bf325328c7c0e120","observation_id":"6c3ca0b3-6f17-4278-91ea-8bdc770e6ab8","resolution":{"observed_at":"2026-08-12T14:55:41.696009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.701937Z","title":"Neural ordinary differential equa- tions","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.701937Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:1aafc2def065a9ecbdf9ebf5081610ebcd6f0d6891fa96c2ac4af39db5d52d96","observation_id":"176a03e3-3585-4682-b716-9361c632876a","resolution":{"observed_at":"2026-08-12T14:55:41.701937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-12T14:55:41.708051Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.708051Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:f836b26b58abfa723206802d3e6878c538e5a492c0fe7fd5f0f445ede82161db","observation_id":"d175ca6c-0151-41b9-931d-d88d3b7e5aa5","resolution":{"observed_at":"2026-08-12T14:55:41.708051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-12T14:55:41.716145Z","title":"How far are we to gpt-4v? clos- ing the gap to commercial multimodal models with open- source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.716145Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:320c844a431714982942fcb85901aef32af107233c6b1d79061a236737ee0fa0","observation_id":"25191846-4385-45d2-9b3c-2d089c505330","resolution":{"observed_at":"2026-08-12T14:55:41.716145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.722362Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.722362Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:824cfb95326200caa7e4aaca8d7dc35001828c5ec18d8eec30d7986e30bc5e03","observation_id":"501a4058-965e-4527-9e11-ea3145a7bef8","resolution":{"observed_at":"2026-08-12T14:55:41.722362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.728465Z","title":"Scaling instruction- finetuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.728465Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:71d909b1d811ff3ea2e4d0cf9421d3b8a03bcc0833776377b630ba05e9657fe9","observation_id":"5b726e95-19f8-45f0-8b58-35bc3250a702","resolution":{"observed_at":"2026-08-12T14:55:41.728465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.732712Z","title":"Emu: Enhancing image generation models using photogenic nee- dles in a haystack, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.732712Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:2ac60cf6e281a67e9b4159fae4142219099999d6717b3b0cb2c1079cb77a0d95","observation_id":"eba7e90d-336e-4732-8b2c-0d22fe4c8c15","resolution":{"observed_at":"2026-08-12T14:55:41.732712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.737254Z","title":"Flow matching in latent space, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.737254Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:0c8bc53fb2190ad443353b2ec42f3c64a9f55a9bb174565223bcb790319369e2","observation_id":"d8c1c698-32e5-456b-8cd3-8567002c9c10","resolution":{"observed_at":"2026-08-12T14:55:41.737254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.741239Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.741239Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:093fec2b9b891cf3268c5920dc1d59b53423a78d93ec09f20830568d36ab911f","observation_id":"30160b63-1f7e-4bd1-b454-e6220f846029","resolution":{"observed_at":"2026-08-12T14:55:41.741239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.745818Z","title":"Diffusion mod- els beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.745818Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:9d6ef43dce367d2c97e37b6e7e5428a270e82b9fc99266fb4d6f158f31070414","observation_id":"25e9dd81-7d42-468a-a8f1-1e7c95279ef6","resolution":{"observed_at":"2026-08-12T14:55:41.745818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.07068","last_updated":"2022-03-25T15:19:21Z","snapshot_observed_at":"2026-08-13T17:15:57.399129Z","submitted_at":"2021-12-14T00:01:34Z","title":"Score-Based Generative Modeling with Critically-Damped Langevin Diffusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.07068","snapshot_observed_at":"2026-08-12T14:55:41.750016Z","title":"Score- based generative modeling with critically-damped langevin diffusion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.750016Z"},"links":{"cited_paper":"/paper/2112.07068","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:08aba6db006d70787e6df91005228131758ebf0120f8695e5c0d4accbca06e82","observation_id":"3170d992-da09-4b55-b246-f300abb86650","resolution":{"observed_at":"2026-08-12T14:55:41.750016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.916893Z","title":"Genie: Higher-order denoising diffusion solvers, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.916893Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:16814c6cd1140b83a82c5391792dbc6269fc7397764c066f2b1e9907d8490794","observation_id":"75ed7e6a-011b-47e4-bc52-d0c44e83d0bf","resolution":{"observed_at":"2026-08-12T14:55:41.916893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T14:55:41.926416Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.926416Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:5ccbb36c191b9612e0bd843777a1601ac0a8bf48fa450950f3236349dc58cbe6","observation_id":"f4ddbcc5-6fb1-4c1f-baa9-c945f0f687fc","resolution":{"observed_at":"2026-08-12T14:55:41.926416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.941194Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.941194Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:8baed2fd1d4b63d44ce16db097d30cdea5154d5cd573ef6c3db9734dd4cd289a","observation_id":"1ccdc236-c7d0-4296-997e-de66917651fc","resolution":{"observed_at":"2026-08-12T14:55:41.941194Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.948763Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.948763Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:b803a1f4abd19dc5eed7f38f6e6fb8e8f05d7eb18c5421dbb9f1c648f513afbb","observation_id":"775a4ac7-8ab4-49e9-a83f-433612101e38","resolution":{"observed_at":"2026-08-12T14:55:41.948763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13863","last_updated":"2024-10-17T17:59:59Z","snapshot_observed_at":"2026-08-13T23:30:37.164749Z","submitted_at":"2024-10-17T17:59:59Z","title":"Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13863","snapshot_observed_at":"2026-08-12T14:55:41.953638Z","title":"Fluid: Scaling autoregressive text-to-image generative models with continuous tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.953638Z"},"links":{"cited_paper":"/paper/2410.13863","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:3e836c2866de9b04661a5c5c0c1d436b0e532cb30d232e4dd27f128fffbbda9a","observation_id":"123275f2-91bb-431b-84be-8620261977bc","resolution":{"observed_at":"2026-08-12T14:55:41.953638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.961852Z","title":"Ernie-vilg 2.0: Improving text-to- image diffusion model with knowledge-enhanced mixture- of-denoising-experts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.961852Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:9c88aa31a606a14d9f63cfd6a8550058397d36c5d34a240686ea9f1412272be3","observation_id":"827f6d5a-a70b-4b57-a91e-8f14fd744b5c","resolution":{"observed_at":"2026-08-12T14:55:41.961852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07360","last_updated":"2024-12-04T17:58:35Z","snapshot_observed_at":"2026-08-13T05:04:05.826107Z","submitted_at":"2023-12-12T15:30:24Z","title":"Boosting Latent Diffusion with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07360","snapshot_observed_at":"2026-08-12T14:55:41.966445Z","title":"Boost- ing latent diffusion with flow matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.966445Z"},"links":{"cited_paper":"/paper/2312.07360","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:904034aefaecac30e9f56af799707ce9f5abe16de32e0086bc13966294153eb0","observation_id":"30e130dd-b2b9-4a9b-804b-43137a2e8500","resolution":{"observed_at":"2026-08-12T14:55:41.966445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.971810Z","title":"If: A github repository","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.971810Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:72a27392aa15bd4a888ac9f4a712fe53cd0efa2b510bba3071d5a24e0fc48e9f","observation_id":"a64af342-f6fd-43cc-a7ee-a4bf09b8903a","resolution":{"observed_at":"2026-08-12T14:55:41.971810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-08-13T00:10:49.002216Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-12T14:55:41.976670Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.976670Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:9bedb5f43affd1716cd3fdc4f3b1c72981db45ae58fe10da16b7447336a274fb","observation_id":"9e7b1660-f2e0-45cf-9b58-eb7aebe52921","resolution":{"observed_at":"2026-08-12T14:55:41.976670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.982687Z","title":"Geneval: An object-focused framework for evaluating text- to-image alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.982687Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:7631fbe1cb480b59cbe057324ccac8942fabd2c83cf9a3b44a8d84d90ba24bb1","observation_id":"493dd55e-efbd-4bb5-9e0a-b3d3d770b1bd","resolution":{"observed_at":"2026-08-12T14:55:41.982687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.989159Z","title":"Photorealistic video generation with diffusion models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.989159Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:75b1990059740c567ad3b9f7aa7545824bc42a5412ab2fc17330ca742b2ffc71","observation_id":"171b0ba8-928f-4bda-a73f-14e0cc7d0887","resolution":{"observed_at":"2026-08-12T14:55:41.989159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.994325Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.994325Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:5b48efef136ed6a82069cf77b2a68f14293830967dd32ff4e40a289b141c06ba","observation_id":"8e41062b-ce9d-4c5b-b924-3a182ad37fb4","resolution":{"observed_at":"2026-08-12T14:55:41.994325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:41.999554Z","title":"Masked autoencoders are scal- able vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.999554Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:33cea733de49ac2378fa2bc35b0866c6fb4ce320f1b8b6147dd584b77afc9296","observation_id":"f604fd9f-0ae3-48bd-a25a-59023889cfdf","resolution":{"observed_at":"2026-08-12T14:55:41.999554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.009907Z","title":"Rethinking image aesthetics assessment: Models, datasets and benchmarks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.009907Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:1257d3ad98df57d75b9de9ac698afc201870547c4d1476fba71f278da06d8912","observation_id":"01123c0b-380a-44ab-96da-ae7b8e6f2770","resolution":{"observed_at":"2026-08-12T14:55:42.009907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.015663Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.015663Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:83ed62f338007c98fe7fbf5e6ee6bd29f49633299aa1b83f303cd52d4f0f93cb","observation_id":"346414f4-f99a-4b80-8222-d80be90dbfc4","resolution":{"observed_at":"2026-08-12T14:55:42.015663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-12T14:55:42.022584Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.022584Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:934e69bcad0aafd480a5c645743c2b3395b83baf8ceb229cb70d5e644f15ce1b","observation_id":"ad773235-83c2-40c7-afe0-53d6bed67ec8","resolution":{"observed_at":"2026-08-12T14:55:42.022584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.027402Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.027402Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:54f37fdaf7a3f08484170d5ca7dc075757051623fc8d8afd8fec3d17e1384f63","observation_id":"8ab4d461-7a3a-4ec3-8b19-39ec996c897b","resolution":{"observed_at":"2026-08-12T14:55:42.027402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.035731Z","title":"Visual comparison between HunyunDit [65] and D-JEPA·T2I","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.035731Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:a4ccc2c4be11375acd9cdc1f44cdb68440a607a0675cba68e09be3672041944f","observation_id":"0c4c436e-0262-4875-bac0-a25a22202396","resolution":{"observed_at":"2026-08-12T14:55:42.035731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.041829Z","title":"Cascaded diffusion models for high fidelity image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.041829Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:e7b3d2369807213179d1be00652888f62aa31ab5467f503ec16222d741393102","observation_id":"625453d7-db29-4d20-98de-85cc8b11e3ec","resolution":{"observed_at":"2026-08-12T14:55:42.041829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-12T14:55:42.047079Z","title":"Training compute-optimal large language mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.047079Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:dcb6a7c8b965cbc6c8f0ed78c5708416993222a750fd554ce576940391f864af","observation_id":"46007515-6fb6-4363-ac6b-3047160199fe","resolution":{"observed_at":"2026-08-12T14:55:42.047079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.051812Z","title":"T2i-compbench: A comprehensive bench- mark for open-world compositional text-to-image genera- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.051812Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:2a1506f6aad167fb5e1f5266be1018aa33cd84e074828b132ce4170755381c14","observation_id":"c55bc952-1cd6-4db5-9232-4e47da42a719","resolution":{"observed_at":"2026-08-12T14:55:42.051812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.056336Z","title":"Estimation of non- normalized statistical models by score matching","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.056336Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:d1377f1607d9415139c5137a9cc324cd719e13c51abbcbf9f8b70cf3de619c7b","observation_id":"f5051507-7291-4b4d-9bd4-7c150936dc17","resolution":{"observed_at":"2026-08-12T14:55:42.056336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.061298Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.061298Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:76f9d39fff7a20ce7f6708c7d4ced34b28e4f85c329990a5d6550ee805b45ae8","observation_id":"797ad938-a9aa-4dc9-ac36-b168be063a4d","resolution":{"observed_at":"2026-08-12T14:55:42.061298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.065590Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.065590Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:bbee80b4f8b03db1688eb1af48995b401061cc16a5d02ced9c2027a2f4deffd5","observation_id":"03962d96-9ce8-42eb-a06a-a7bb6ff0cd4c","resolution":{"observed_at":"2026-08-12T14:55:42.065590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13218","last_updated":"2024-05-24T13:58:09Z","snapshot_observed_at":"2026-08-13T00:02:38.464839Z","submitted_at":"2024-05-21T21:49:39Z","title":"Computational Tradeoffs in Image Synthesis: Diffusion, Masked-Token, and Next-Token Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13218","snapshot_observed_at":"2026-08-12T14:55:42.069501Z","title":"Computational tradeoffs in image synthesis: Diffusion, masked-token, and next-token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.069501Z"},"links":{"cited_paper":"/paper/2405.13218","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:844dcfc64efe9471b2d0911940ed779ba738b4ffc7b8d68781be3437fec0d31e","observation_id":"3674d533-0937-4fd2-b872-58f55359acb1","resolution":{"observed_at":"2026-08-12T14:55:42.069501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.074264Z","title":"Understanding diffu- sion objectives as the elbo with simple data augmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.074264Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:c18ea5de24ff9226e2756ea3a40eacbd54e4e845cc51231fae28dca55f886103","observation_id":"b43e82ad-9cde-4715-bc95-04c89d18399c","resolution":{"observed_at":"2026-08-12T14:55:42.074264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.078521Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.078521Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:95c456255ec95fafd2f1e86e945c8d3c4bdfc2707f53fd299d8d1ba00a528a15","observation_id":"93249733-0401-44bf-96ea-109e8e4bc64c","resolution":{"observed_at":"2026-08-12T14:55:42.078521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.083271Z","title":"Flux.1: An open-source image genera- tion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.083271Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:ae55d0dcd923ea0dbb7da4cd62240f28e79b9cd11b8f589b437287444b2aaa71","observation_id":"f94f2d03-08da-4764-93be-0635b5ba7ea5","resolution":{"observed_at":"2026-08-12T14:55:42.083271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.088512Z","title":"Bloom: A 176b-parameter open-access multilingual language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.088512Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:8e7862b8f387035810ba0a559706398100ddd21374a18f7671b3c62d46f963fb","observation_id":"32bd2fd6-2c0d-4cf2-8970-78b683854cb0","resolution":{"observed_at":"2026-08-12T14:55:42.088512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.093959Z","title":"Minimizing trajectory curvature of ode-based generative models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.093959Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:b3363e1147a30a77fec5e959e6b48e04e051421db86786dce9a3028402f543f8","observation_id":"22183a6d-747b-4455-ab08-2e92c642dd15","resolution":{"observed_at":"2026-08-12T14:55:42.093959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13743","last_updated":"2024-11-03T20:22:32Z","snapshot_observed_at":"2026-08-12T23:38:59.439688Z","submitted_at":"2024-06-19T18:00:07Z","title":"GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13743","snapshot_observed_at":"2026-08-12T14:55:42.098059Z","title":"Genai-bench: Evaluating and im- proving compositional text-to-visual generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.098059Z"},"links":{"cited_paper":"/paper/2406.13743","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:4e44f82875af53479d32659786c5bd5eec5d4f71e93480eb70a2ca02dcfd75f7","observation_id":"c00f906e-fc29-4576-8777-748cefb19812","resolution":{"observed_at":"2026-08-12T14:55:42.098059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-08-14T09:04:40.967071Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-12T14:55:42.102956Z","title":"Autoregressive image generation without vec- tor quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.102956Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:bf1f3d62df38737feeb794853b7bd6c1c49ca88de630f568f4080dcea7aa6219","observation_id":"5b8e5a99-7f69-462f-928b-6f66e0c95504","resolution":{"observed_at":"2026-08-12T14:55:42.102956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-12T14:55:42.108525Z","title":"Hunyuan- dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.108525Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:af08e999d4f644e103d9f878caa47079cce246c4f4ca6d2cc996f5f213362ce0","observation_id":"981345a0-6025-41c6-a7b9-3e4e260114b9","resolution":{"observed_at":"2026-08-12T14:55:42.108525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.114847Z","title":"Rich human feedback for text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.114847Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:7f3cb5ad1604761d96c6f13c3ed6cfc23606122c37c2339c2528e1d6d9adc2ad","observation_id":"ce07c99d-54cc-412d-86a2-fed3b7a3d65d","resolution":{"observed_at":"2026-08-12T14:55:42.114847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-12T14:55:42.119342Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.119342Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:c105e97f6a07cc8e244fb5a2b430c67957f67cdc7cf457f266bf6edbdc5ad31b","observation_id":"973cf82a-65dd-4955-a322-fedb30a20778","resolution":{"observed_at":"2026-08-12T14:55:42.119342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.124347Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.124347Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:5c4218112b514990371ea1a6a8727c47d5b4f7e5f48c040c8aa16df0068578c2","observation_id":"a146a521-5fcc-44d5-bccb-3d0e092cd65c","resolution":{"observed_at":"2026-08-12T14:55:42.124347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-14T09:17:25.015096Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-12T14:55:42.128419Z","title":"Lumina-mgpt: Il- luminate flexible photorealistic text-to-image generation with multimodal generative pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.128419Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:fed804455927a561760bbe0df3ae2496044f5d40dd10c7e53659dce0d52aa82b","observation_id":"3ab9b0db-78f6-4386-8037-753973592291","resolution":{"observed_at":"2026-08-12T14:55:42.128419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-12T14:55:42.133163Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow.arXiv preprint arXiv:2209.03003, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.133163Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:d3e41ce359ca508cc60a42dec77cb069e1af7bf44d5159174516ba63011274b2","observation_id":"5cfc6750-c564-4847-9fff-7e049a86656e","resolution":{"observed_at":"2026-08-12T14:55:42.133163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.138637Z","title":"Instaflow: One step is enough for high-quality diffusion-based text-to-image generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.138637Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:a64302ddf2b4dda3892a87cb94f0f2a4017085dd223d60d02ea1608fef1069d1","observation_id":"dad1a6cd-6496-4255-a290-0da1f7e2bcda","resolution":{"observed_at":"2026-08-12T14:55:42.138637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T14:55:42.144742Z","title":"Fixing weight decay regularization in adam","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.144742Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:c9e15816457649dbebf82bd58e0f428c6317c49e3bcc0143ef308331c8fbb944","observation_id":"7501e36b-52e3-400d-b252-ca053b142071","resolution":{"observed_at":"2026-08-12T14:55:42.144742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.154155Z","title":"Dpm-solver++: Fast solver for guided sampling of diffusion probabilistic models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.154155Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:3b397d1d45df148f92b3c97d61222f1e9279eb481b91c16a6323f85d1b163c7f","observation_id":"f6d2ce02-bb0e-4e7e-9d77-96ec4d540d00","resolution":{"observed_at":"2026-08-12T14:55:42.154155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.184771Z","title":"Albergo, Nicholas M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.184771Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:583a4d5003d21b43c2d81d05b24e044bdcfc4fe412605384c6532d5062080026","observation_id":"a67f0147-cfae-4eb5-95b4-1c9a075bec2c","resolution":{"observed_at":"2026-08-12T14:55:42.184771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.190069Z","title":"Midjourney v6 - ai art generator,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.190069Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:91c632ad26da833947cdf5105cb30f4b3217ba56752b86a443ef5fced9a8c02e","observation_id":"184e538d-03d6-4500-8c57-e860fa9ce292","resolution":{"observed_at":"2026-08-12T14:55:42.190069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.207634Z","title":"Freecontrol: Training-free spatial control of any text-to-image diffusion model with any condition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.207634Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:6a17af912bb872b537cf4704ec0acaf5fa7586fff206712e965a6b986dc0f755","observation_id":"720488a1-b541-4823-94a0-3abf6b0ae351","resolution":{"observed_at":"2026-08-12T14:55:42.207634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-12T14:55:42.211836Z","title":"Glide: Towards photorealistic image genera- tion and editing with text-guided diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.211836Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:8181d636e6cfb8d0b062899d2551ace62a991510bfdaa7a154f7a437601cd9d6","observation_id":"eb74614f-2570-48b6-8470-889085f45230","resolution":{"observed_at":"2026-08-12T14:55:42.211836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.219595Z","title":"Training lan- guage models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.219595Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:2069ca2609c43dcc6f42ef80e37ebc0baef01cfa8a0be48eff1711bb80d70081","observation_id":"d9703236-9be4-4609-b8b7-04899cf26c66","resolution":{"observed_at":"2026-08-12T14:55:42.219595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.225299Z","title":"Pavlov, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.225299Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:54e1649cf22eeb3f4362224ea70a38aa348b7fe67f991f5b8795093b2b83d79e","observation_id":"9bbf1d3b-efe2-4016-95ab-d5620993449f","resolution":{"observed_at":"2026-08-12T14:55:42.225299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.235756Z","title":"Scalable diffusion mod- els with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.235756Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:b981454915c3eb4b3a25e4a609d934cdafa59c79244e13f1bb2d995efde43907","observation_id":"b235576b-496f-4815-b535-6671cefa6d87","resolution":{"observed_at":"2026-08-12T14:55:42.235756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.245981Z","title":"Ntk-aware scaled rope allows llama models to have extended (8k+) context size without any fine-tuning and minimal perplexity degrada- tion, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.245981Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:89041484d033ccbb3133e57e750926ef17457cbc8d1232ed112d7ce6e6300493","observation_id":"532bff5e-111b-47a4-af38-cdae587a83db","resolution":{"observed_at":"2026-08-12T14:55:42.245981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.251520Z","title":"Film: Visual reasoning with a general conditioning layer","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.251520Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:233cf0afdf8de53ab2a398b3a89d727dd7a3129acd0489455cb2cda6c89f92b8","observation_id":"0d26dbf9-3e13-46bc-9647-05942d5ac412","resolution":{"observed_at":"2026-08-12T14:55:42.251520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.258081Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.258081Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:38ae4e7b5d981689a42edb09573d30bffdd539d3ced3d8aec6cb1102196b4304","observation_id":"b3ebb336-6d74-48fa-8eb7-5e418d594e38","resolution":{"observed_at":"2026-08-12T14:55:42.258081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.265203Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.265203Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:cc49afdded45f0171522382d510283a9b4ab3546d45947643c41fef76b1fd6d0","observation_id":"b55c53be-783d-43ae-a606-839ec604809d","resolution":{"observed_at":"2026-08-12T14:55:42.265203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.271730Z","title":"Improving language understanding by gen- erative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.271730Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:35e0a73999f823e9199e2d2941b12a68d29d541020cefce1aa1fdeb280c0963d","observation_id":"dd30535c-b4b3-4531-adb1-884d277402de","resolution":{"observed_at":"2026-08-12T14:55:42.271730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.279705Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.279705Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:280a071665a52d6d1d76ce84323e228b59d7191e6985bf3000fb176870ceecc6","observation_id":"523f7d07-4038-472a-894c-d77794d8fcc9","resolution":{"observed_at":"2026-08-12T14:55:42.279705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.284217Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.284217Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:41ae4cc355c76729ddd0a3d15d045811824c63e3f52118e6a42d2e02567bd4f6","observation_id":"aef469e7-8091-4bd4-a64c-d2b2e709b7b1","resolution":{"observed_at":"2026-08-12T14:55:42.284217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.289957Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.289957Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:d01317cb767ae9e407a94f2433d3ce0054fc1c585a9a8d8a7829449b74158f6e","observation_id":"d9550ff4-1773-4d70-a7f1-68a102e830d0","resolution":{"observed_at":"2026-08-12T14:55:42.289957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.306062Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.306062Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:a995ff0a12428af9b31dff39aa6b0ee429b572a038bd2bbbae81e051ab8df8bf","observation_id":"7c6fbb83-ca38-49dc-97f0-dd0e5f929ba5","resolution":{"observed_at":"2026-08-12T14:55:42.306062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:44.050095Z","title":"Hierarchical text-conditional image generation with clip latents, 2022","venue":null,"work_id":"e2778803-08f8-4b42-8b4b-0ca571cf1eff","year":2022},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.313742Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:30e0e01f0fe10b6cdce58abe1d7c63bb7d9cdd60da30beb0ca6b0ad8fb73442f","observation_id":"acf0ed78-5932-4687-8357-83f0fe47cf56","resolution":{"observed_at":"2026-08-12T14:55:44.054627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:44.036316Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion param- eters","venue":null,"work_id":"bdb1479f-d0b4-4f34-bbd9-d7acd0dd2f56","year":2020},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.318387Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:a8f3e3da969e8d6e72c93c668ee5464bae7e0ce0f922b92d0683f6859a397ffb","observation_id":"fb5d152b-6ea2-4863-a1d3-ba8902b12b47","resolution":{"observed_at":"2026-08-12T14:55:44.041121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:44.022653Z","title":"Gener- ating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":"a84da3ed-afb6-400f-bda1-8ac4d8472019","year":2019},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.322486Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:cbf817121c6097971776ea3c8aa1f1e51945dbea38d7d656540d5c9958f49f45","observation_id":"66626cc8-837f-4fed-9111-ebfdb6106ec1","resolution":{"observed_at":"2026-08-12T14:55:44.026994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:44.010231Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"9238574c-9836-4c35-99d8-7a17c9d3b2e3","year":2022},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.326308Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:c6295d11df2fe9514f726a1393383485c05d856dc73185046b829eccd95678f8","observation_id":"0ee604bb-cd28-485a-8613-4341e0824535","resolution":{"observed_at":"2026-08-12T14:55:44.014565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:43.995024Z","title":"Im- agenet large scale visual recognition challenge","venue":null,"work_id":"02d33340-5777-441d-8ad8-530a116c8640","year":2015},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.331271Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:c3afdd614e2da4b4476dfb6881b5c59aa68df7624357fb360f230a0557186c76","observation_id":"a421d31d-c8fe-47f5-ab1f-e1b1294a76ef","resolution":{"observed_at":"2026-08-12T14:55:44.000541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.335352Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.335352Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:3b3a35c5d5d3a542d0dcd40f2c6604cf6332e484118e141fee772fa095df440a","observation_id":"bdfbfe9f-f59b-4095-bf98-a26a3d2d8d47","resolution":{"observed_at":"2026-08-12T14:55:42.335352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:43.969592Z","title":"Adversarial diffusion distillation","venue":null,"work_id":"3637be4d-012d-4f4f-9c34-f5ec79c0073e","year":2025},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.339216Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:4a1fad62d789311eac7b313c43cd16e63fbcc481e143e5fd9a77963d652376fd","observation_id":"37572a9e-eeac-4e01-bb1f-7f1eae695253","resolution":{"observed_at":"2026-08-12T14:55:43.977762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:43.931767Z","title":"Laion-5b: An open large-scale dataset for train- ing next generation image-text models","venue":null,"work_id":"1bd2e6d6-d074-4138-8baa-fa53578a4233","year":2022},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.345329Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:aa424d3a0b047000046f2fcf75e5c81b876c85e33e83b6a0406f687fa39d15b4","observation_id":"3275ad53-baff-4a89-bfe3-fbaf859699c4","resolution":{"observed_at":"2026-08-12T14:55:43.936623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:43.916974Z","title":"Make-a-video: Text-to-video generation without text-video data, 2022","venue":null,"work_id":"d4715ec6-115e-47f5-9ab1-4e4cf2c05ea6","year":2022},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.349972Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:ed882c3d40dd41149e0e5c99c99ef5ed4716d32a466849acada58afc1c07878f","observation_id":"2f352fd4-3af4-4ace-ac93-4ab8fbb9c95f","resolution":{"observed_at":"2026-08-12T14:55:43.921928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:42.357262Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.357262Z"},"links":{"citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:a1c14953c6c682a68af9fae5975cd8b3345db23377a17563cb402ba5c0fea5d7","observation_id":"688b3afa-b894-4c42-828a-57d96c244586","resolution":{"observed_at":"2026-08-12T14:55:42.357262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-12T14:55:42.363118Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.363118Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:f688121f3dc27e9ece8ba4f0d5df0588b52ce8919083bf05e5feef0fa6e1666b","observation_id":"489d3f92-fdf3-4947-8d14-095fd99fb28d","resolution":{"observed_at":"2026-08-12T14:55:42.363118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":91,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":137},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 100 of 137 outbound references and 0 inbound Pith citation observations for arXiv:2411.14808."}