{"as_of":"2026-08-12T17:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dc8242b0b484ba2d31f3ace998e6d3e2aa6299a5d6ad18f4b8d243d3636dbe1c","coverage":[{"denominator":120,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:37:42.215299Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:12:05.860105Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T15:17:07.173716Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15321","snapshot_observed_at":"2026-08-10T23:12:05.860105Z","title":"Next patch prediction for autoregressive visual generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20964","last_updated":"2024-12-30T14:09:15Z","snapshot_observed_at":"2026-08-12T02:07:07.949624Z","submitted_at":"2024-12-30T14:09:15Z","title":"Hierarchical Banzhaf Interaction for General Video-Language Representation Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:05.860105Z"},"links":{"cited_paper":"/paper/2412.15321","citing_paper":"/paper/2412.20964"},"observation_digest":"sha256:7e82ae17577dcf5f64301c5c7884edad42710767a7d2259ad2723aa7ffe5203a","observation_id":"1457285d-4191-414b-bd55-2cec95ab0033","resolution":{"observed_at":"2026-08-10T23:12:05.860105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15321","snapshot_observed_at":"2026-08-10T22:11:01.792501Z","title":"E.; Lim, S.-N.; Yang, H.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02807","last_updated":"2025-01-07T07:47:22Z","snapshot_observed_at":"2026-08-10T22:22:41.493983Z","submitted_at":"2025-01-06T07:00:22Z","title":"AE-NeRF: Augmenting Event-Based Neural Radiance Fields for Non-ideal Conditions and Larger Scene","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T22:11:01.792501Z"},"links":{"cited_paper":"/paper/2412.15321","citing_paper":"/paper/2501.02807"},"observation_digest":"sha256:1dabfbd78de18f3699fad786a2f8911a03954cd287eccde8291ba0d1101b29e8","observation_id":"d2fb46c3-45f2-4412-b0c8-2329aa1008c0","resolution":{"observed_at":"2026-08-10T22:11:01.792501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15321","snapshot_observed_at":"2026-08-06T20:53:50.885357Z","title":"Next patch prediction for autoregressive visual generation.arXiv preprint arXiv:2412.15321, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01652","last_updated":"2025-07-02T12:27:06Z","snapshot_observed_at":"2026-08-09T07:28:28.701691Z","submitted_at":"2025-07-02T12:27:06Z","title":"Autoregressive Image Generation with Linear Complexity: A Spatial-Aware Decay Perspective","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:50.885357Z"},"links":{"cited_paper":"/paper/2412.15321","citing_paper":"/paper/2507.01652"},"observation_digest":"sha256:c66a8a9ac4a7dcab8f419050a7ebc2723fa8269a2031ef9991267368920d76fc","observation_id":"b1206060-f4c2-4603-a6da-2288fef146a0","resolution":{"observed_at":"2026-08-06T20:53:50.885357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15321","snapshot_observed_at":"2026-08-05T20:51:42.414004Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09912","last_updated":"2025-08-23T15:54:38Z","snapshot_observed_at":"2026-08-07T04:35:30.224174Z","submitted_at":"2025-08-13T16:09:36Z","title":"E-4DGS: High-Fidelity Dynamic Reconstruction from the Multi-view Event Cameras","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T20:51:42.414004Z"},"links":{"cited_paper":"/paper/2412.15321","citing_paper":"/paper/2508.09912"},"observation_digest":"sha256:ecd561a5bcec84dd392751303ce3f08ae81b63623b4f3266edc6a3347c9eca4e","observation_id":"e3225084-d36a-40d3-8b5c-273ad0ed1248","resolution":{"observed_at":"2026-08-05T20:51:42.414004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"cited_work":{"arxiv_id":"2412.15321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15321","snapshot_observed_at":"2026-07-02T15:17:07.173716Z","title":"arXiv preprint arXiv:2412.15321 (2024)","venue":null,"work_id":"b832524a-4d33-4391-ad52-79233a357771","year":2024},"citing_paper":{"arxiv_id":"2607.00371","last_updated":"2026-07-01T03:11:21Z","snapshot_observed_at":"2026-08-02T15:32:07.000409Z","submitted_at":"2026-07-01T03:11:21Z","title":"MEPA: Multi-Scale Representation Alignment for Visual Autoregressive Modeling with Mixture of Experts","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-02T15:14:36.946247Z"},"links":{"cited_paper":"/paper/2412.15321","citing_paper":"/paper/2607.00371"},"observation_digest":"sha256:0ef994023e97588bf2a6efb2f997d8ce536718839ab08e905303a57508affde2","observation_id":"babc43c3-2653-46cd-b273-e9fa7cb8192a","resolution":{"observed_at":"2026-07-02T15:17:07.176042Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.15321/citation-record","integrity":"/paper/2412.15321/integrity","json":"/paper/2412.15321/citation-record.json","paper":"/paper/2412.15321"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.867328Z","title":"Revisiting neural scaling laws in language and vi- sion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.867328Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:3013f6e4e18995ab552e340a455e1e87348e3655f6d0f00982cb6e2b67582ebe","observation_id":"f2678b4c-a8a7-472e-bd8d-4f7c35dade05","resolution":{"observed_at":"2026-08-11T11:37:41.867328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-11T11:37:41.871583Z","title":"Palm 2 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.871583Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:220d2d64030c45af6d74c5e00ec7fe7eb0bc3b7315911a0e15ccca530c0c20ef","observation_id":"c6e1ecb5-c01d-4f59-95d1-a8187bc02fc8","resolution":{"observed_at":"2026-08-11T11:37:41.871583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.875792Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.875792Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:a00d57b44f77fc661236ba6c458f521c87d886046fac11dca33bb5b860722277","observation_id":"04f60c00-a63e-4c40-aaf7-247fbdc99b95","resolution":{"observed_at":"2026-08-11T11:37:41.875792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T11:37:41.879419Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.879419Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:6f0171e405606db75fd0b676f2716d18a8f0307698d7dd3878ae1af117df1d9a","observation_id":"e3d8c713-e14b-4b1c-9628-d7c70cc5060e","resolution":{"observed_at":"2026-08-11T11:37:41.879419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00785","last_updated":"2023-12-01T18:59:57Z","snapshot_observed_at":"2026-07-31T06:02:58.625623Z","submitted_at":"2023-12-01T18:59:57Z","title":"Sequential Modeling Enables Scalable Learning for Large Vision Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00785","snapshot_observed_at":"2026-08-11T11:37:41.882975Z","title":"Sequential modeling enables scal- able learning for large vision models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.882975Z"},"links":{"cited_paper":"/paper/2312.00785","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:52e639975a7e87f7730a75fde2e266be051ce8bf8658a2710c786a87206c09bd","observation_id":"2f64a344-5a30-4338-ab0a-b66c14123c28","resolution":{"observed_at":"2026-08-11T11:37:41.882975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.886704Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.886704Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:5b3afbd63362c071ebdbbbdbc1dfa7292f9bdd8f1749e1f5c8bbf95f3d830665","observation_id":"89581c38-6b10-45d2-8fc5-8ca4948c2250","resolution":{"observed_at":"2026-08-11T11:37:41.886704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-10T17:03:38.042994Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-11T11:37:41.890237Z","title":"Deepseek llm: Scaling open- source language models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.890237Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:85a0594aa37a9856ff430a37ae71561725d96d7d8be4870999117ded269ec9a8","observation_id":"dfcf8ced-fa11-4fc5-95f2-c0a211c7eaae","resolution":{"observed_at":"2026-08-11T11:37:41.890237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.11096","last_updated":"2019-02-25T21:32:06Z","snapshot_observed_at":"2026-07-06T07:04:57.275371Z","submitted_at":"2018-09-28T15:38:49Z","title":"Large Scale GAN Training for High Fidelity Natural Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.11096","snapshot_observed_at":"2026-08-11T11:37:41.894050Z","title":"Large scale gan training for high fidelity natural image synthesis","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.894050Z"},"links":{"cited_paper":"/paper/1809.11096","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:828e9d7128e8608c3dbdc761f3ead53a5d86f8c8bc76572bf09bc57b4e0f9aa8","observation_id":"90f1afab-de10-40bc-847a-7494ccf00d03","resolution":{"observed_at":"2026-08-11T11:37:41.894050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.897862Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.897862Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:d903edb035935297948f26cfdb6ffafa37501305febb2bb20081e27175ba8828","observation_id":"5f44bb7f-536d-4a2f-a0d7-131cb81d77ad","resolution":{"observed_at":"2026-08-11T11:37:41.897862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.901097Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.901097Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:b60812eac53690c71d2d4803391ab15446c0441223535449085e20fd65c93e7a","observation_id":"c4b1364c-ebe0-47d4-91d6-c760ef16ec34","resolution":{"observed_at":"2026-08-11T11:37:41.901097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-11T11:37:41.904410Z","title":"Muse: Text- to-image generation via masked generative transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.904410Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:dfad4a744938cff20f5870476f6e862ab9aa84db885dd80adb1dbcde9d199979","observation_id":"d99c398d-87eb-4f0b-adf8-dd4f3625554c","resolution":{"observed_at":"2026-08-11T11:37:41.904410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.908140Z","title":"Softvq-vae: Efficient 1-dimensional con- tinuous tokenizer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.908140Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:413e0900e8904783b49f558ddb4c26e0a5bf258f8bf91e322baa6230a7c686f5","observation_id":"7e9c81ff-e777-491c-b4f5-50c16d550645","resolution":{"observed_at":"2026-08-11T11:37:41.908140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-11T11:37:41.911439Z","title":"Pixart: Fast training of diffu- sion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.911439Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:bb1e9edee68265559f046abcfe0484adf736a83b9b49ccf346cc7f73264cacba","observation_id":"8bf2de5f-4eef-437a-aa5e-36ad1a70eddc","resolution":{"observed_at":"2026-08-11T11:37:41.911439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04557","last_updated":"2024-06-02T09:30:39Z","snapshot_observed_at":"2026-08-04T22:39:48.218541Z","submitted_at":"2023-12-07T18:59:30Z","title":"GenTron: Diffusion Transformers for Image and Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04557","snapshot_observed_at":"2026-08-11T11:37:41.915325Z","title":"Gentron: Delving deep into diffusion transformers for image and video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.915325Z"},"links":{"cited_paper":"/paper/2312.04557","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:8b66ffacddc5ec05783ef5afcd67ab1c64b70d5c8464fdcb21a4ebfa1e9ef9b7","observation_id":"220ef9b3-00dc-4421-824e-efdf971ba888","resolution":{"observed_at":"2026-08-11T11:37:41.915325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-11T11:37:41.918863Z","title":"Janus- pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.918863Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:8c5afd3b5f6a458d7e736ba6fe5ed7c80fcbf386b8d67d887d34eb53c39a2f92","observation_id":"c9d3ace6-f9f3-434a-9176-17a4333537e4","resolution":{"observed_at":"2026-08-11T11:37:41.918863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.922411Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.922411Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:231536cf09d8d5c029f0f1a86c2a76caeb1f7d7b4101fd1e1382039d421ee838","observation_id":"1fb8c0bb-85e2-4cdb-910d-2b0c8c946382","resolution":{"observed_at":"2026-08-11T11:37:41.922411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.925388Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.925388Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:78e114879198d2ea2e7167b0bcf4dc0661c2623525a5a28786d7ea725fcf7b8a","observation_id":"2ad967ac-6d14-4e0e-9ddf-0902be8561a9","resolution":{"observed_at":"2026-08-11T11:37:41.925388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.928364Z","title":"Deepseek-r1: Incentivizing reasoning capa- bility in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.928364Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:fa970dd07d51ef50e900aa7011ed8cc5602a0507e65e20e6a0cdd84d4c01a2be","observation_id":"f5c6e865-33db-44b1-8925-007933e685e3","resolution":{"observed_at":"2026-08-11T11:37:41.928364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.931046Z","title":"Autoregressive video generation with- out vector quantization, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.931046Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:12ea0fb842cbe8a1dda2e97a16bfc2aa1ab250eac0d01704d31bbc1438dbc5df","observation_id":"b8798375-3b51-41d9-8eea-3106105cdfe3","resolution":{"observed_at":"2026-08-11T11:37:41.931046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.933725Z","title":"Imagenet: A large-scale hierarchical im- age database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.933725Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:5e9e6dfaf38adb88965da8ef77ae6a801cd54790a6e2ef995210f64b15904af5","observation_id":"33125c8e-daec-4ff4-9ecf-514bcd806083","resolution":{"observed_at":"2026-08-11T11:37:41.933725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-11T11:37:41.936489Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.936489Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:67b95f58e3c8f0500d83200aff2d7b9adbb105d126bfd8335d08f6c345b92204","observation_id":"2f67ab22-9600-4b34-b43e-ebdd56750ba5","resolution":{"observed_at":"2026-08-11T11:37:41.936489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.939360Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.939360Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:45b866da0d840dca1a66224516c94fe577df823870673cc6a0446ac07d87ce45","observation_id":"e14eb8f3-a7ff-461d-aa05-69f6fa20ba06","resolution":{"observed_at":"2026-08-11T11:37:41.939360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.941969Z","title":"DreamLLM: Synergistic multimodal com- prehension and creation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.941969Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:cc2f2a71d21e06f4b18f483d00beaa9dd0b9a05b59e04baacef9689c1f0681e0","observation_id":"b15cd339-15e3-4bc5-ad53-6ce19fcbc589","resolution":{"observed_at":"2026-08-11T11:37:41.941969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.945072Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.945072Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:82491b1758d1cf1501d4b921fa717a451493aa01b5d4a1282daf4cba57fd5bd2","observation_id":"501a85bf-e889-47f6-a35a-fd197efe3114","resolution":{"observed_at":"2026-08-11T11:37:41.945072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.948693Z","title":"Scaling rectified flow transformers for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.948693Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:2a4781dcaf34689e81b1d6bee85393359f359af923a51c852e2fb1c44d6a7aae","observation_id":"35823c8f-67a9-4f11-ab41-2a32498df1f2","resolution":{"observed_at":"2026-08-11T11:37:41.948693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-02T03:02:58.907220Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-08-11T11:37:41.952024Z","title":"Making llama see and draw with seed tokenizer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.952024Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:8890aed7deff8178cf44cf608b4a68671f99e3763f86164f840bbbac5205c832","observation_id":"50ed3788-2b69-4a11-939a-294476e8b714","resolution":{"observed_at":"2026-08-11T11:37:41.952024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.955591Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.955591Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:354fd229d7d66b43895ffd39f446c7d695bbdcdf71314fb9000190532359b436","observation_id":"8214e03a-a089-41b2-b337-074ea15b8a8b","resolution":{"observed_at":"2026-08-11T11:37:41.955591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.958864Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.958864Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:8e1eb26ae385e6af2399a2bc77fe6faae8fc7f82a945c59ae131e31bdcbf94f0","observation_id":"e9b80d46-a249-4253-8782-73b8fc4d698a","resolution":{"observed_at":"2026-08-11T11:37:41.958864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08159","last_updated":"2025-01-23T17:08:57Z","snapshot_observed_at":"2026-08-12T03:19:04.310839Z","submitted_at":"2024-10-10T17:41:54Z","title":"DART: Denoising Autoregressive Transformer for Scalable Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08159","snapshot_observed_at":"2026-08-11T11:37:41.962012Z","title":"Dart: Denoising autoregressive trans- former for scalable text-to-image generation.arXiv preprint arXiv:2410.08159, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.962012Z"},"links":{"cited_paper":"/paper/2410.08159","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:dcfb057ea2084c41e547dff7db85c301b877197710a9364aed6be976da78b124","observation_id":"1d92170d-9fd9-41d1-8f30-38b7edebabe2","resolution":{"observed_at":"2026-08-11T11:37:41.962012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.965659Z","title":"Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.965659Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:ec1afef712438b3ed844fb4a0573e74c3badde6a6aba2330e36d861434359c05","observation_id":"5f7a98de-699f-4d50-b3d1-1e38eb6e50d6","resolution":{"observed_at":"2026-08-11T11:37:41.965659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04062","last_updated":"2025-06-29T07:13:36Z","snapshot_observed_at":"2026-08-11T21:46:03.806615Z","submitted_at":"2024-12-05T10:57:08Z","title":"ZipAR: Parallel Auto-regressive Image Generation through Spatial Locality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04062","snapshot_observed_at":"2026-08-11T11:37:41.968876Z","title":"Zipar: Accel- erating autoregressive image generation through spatial lo- cality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.968876Z"},"links":{"cited_paper":"/paper/2412.04062","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:c45292d707048e0dc665b77010fa1f999d9f7ebc31895e883aad577fcdca600d","observation_id":"5c62801d-ef20-4771-a732-61e78b761156","resolution":{"observed_at":"2026-08-11T11:37:41.968876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-11T11:37:41.972477Z","title":"Scaling laws for autoregressive generative modeling","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.972477Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:1054a0a69702251f120389b1bd6f87b3eca7d1f14d8fc5c65ae7e0caad575c32","observation_id":"e6493f08-ffd8-49d4-8262-3177b447e512","resolution":{"observed_at":"2026-08-11T11:37:41.972477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.976043Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.976043Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:aff93d6ce31302651919f7f1b351d03a2d02f7de37205d71e82c55c0554e2fce","observation_id":"9cf56f31-d9af-46d3-bd69-4bbf2a8b6c9c","resolution":{"observed_at":"2026-08-11T11:37:41.976043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-11T11:37:41.979203Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.979203Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:59b6e86057d1832bd80533c7b56acd74d15d2c0cd5700f1e5f5d2f69f247f3b5","observation_id":"800ae06a-9a0d-4fb2-9142-753bc256bf3b","resolution":{"observed_at":"2026-08-11T11:37:41.979203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.982421Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.982421Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:2b23acc65a52cfad8e7371d857fae0a09c3b624eb47423b48720e1f098aba4b0","observation_id":"535a6ee1-8ef3-4c14-b499-eb2a4d5b0045","resolution":{"observed_at":"2026-08-11T11:37:41.982421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.989225Z","title":"Cascaded diffusion models for high fidelity image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.989225Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:67f8c1e501bc7b78b2dd0c1ce6cc16f40e64da2c2e7a9bf3f5267ad8677ca51a","observation_id":"b905402e-2b15-4010-889e-781cb79b73a1","resolution":{"observed_at":"2026-08-11T11:37:41.989225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-11T11:37:41.992403Z","title":"Training compute-optimal large language mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.992403Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:3f4a4d1e040d679f2859555804d98eafff4249810c4a5e1a755380cd65bb92d7","observation_id":"8eae2842-301c-4d4e-8b59-368800c09ca9","resolution":{"observed_at":"2026-08-11T11:37:41.992403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16085","last_updated":"2025-06-15T05:35:19Z","snapshot_observed_at":"2026-08-10T13:42:15.241108Z","submitted_at":"2025-01-27T14:33:27Z","title":"ARFlow: Autoregressive Flow with Hybrid Linear Attention","version":2},"cited_work":{"arxiv_id":"2501.16085","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.16085","snapshot_observed_at":"2026-08-11T11:37:42.782009Z","title":"ARFlow: Autoregressive Flow with Hybrid Linear Attention","venue":"cs.CV","work_id":"d4e79d11-45fd-42a3-acb6-e26f871575b3","year":2025},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.995809Z"},"links":{"cited_paper":"/paper/2501.16085","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:90e6f810211404daa150a22b80c48bbe07f268785bd40dcbcb0006f291f24ea2","observation_id":"5f6d48e9-ffdc-450c-8651-02ffab45ed0e","resolution":{"observed_at":"2026-08-11T11:37:42.787730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:41.999372Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video under- standing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:41.999372Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:596a1847e2415d766c863cf777ad197fbeb89cc62eeb40bba5978fbb85756fbd","observation_id":"6ea85648-9296-4445-a02c-77370a3e7108","resolution":{"observed_at":"2026-08-11T11:37:41.999372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:42.002716Z","title":"Scal- ing up gans for text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.002716Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:a4e787e6ffaf57fec83b1170a2a73a5d89fd03c4f2114aad12fa643d478bdaa0","observation_id":"4c86337c-43ae-4bc6-8a3b-b74af73c6735","resolution":{"observed_at":"2026-08-11T11:37:42.002716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-11T11:37:42.009440Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.009440Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:5edc6b009ae9205a1af852b376ba57e654b0954bc73be381ee2d8633bfb9fa94","observation_id":"876a8aef-bea5-4f1b-a1be-9877573cfc1a","resolution":{"observed_at":"2026-08-11T11:37:42.009440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:42.012633Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.012633Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:c8ffc47834d9527dbbd5c50ccd653984999be9503ee508b4c191ddc2c3e4b36a","observation_id":"cbdf7a2e-51f6-4154-9921-ab86926f9011","resolution":{"observed_at":"2026-08-11T11:37:42.012633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-11T11:37:42.015717Z","title":"Auto-encoding vari- ational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.015717Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:3bdcd5ea834e08fae5357addcf3c6b60b41d295c68b683fd0c8709105885c89e","observation_id":"63dde569-3f17-425e-89e3-6f47c39b9c42","resolution":{"observed_at":"2026-08-11T11:37:42.015717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:42.019036Z","title":"Autoregressive image generation using residual quantization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.019036Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:4060e6b45faeb5e3b4916466787e45e2fec7aaac9d6a671480f48f51dbd04c7b","observation_id":"421e1f81-4312-4385-97fc-6c3f7f722b44","resolution":{"observed_at":"2026-08-11T11:37:42.019036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-11T11:37:42.022394Z","title":"Playground v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.022394Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:a636aaf0c2aeb2f0148b36027240559f1e544f0df8503c5b4aee12ed1560a3f9","observation_id":"cc82f279-1b58-4284-ac40-d8741e717245","resolution":{"observed_at":"2026-08-11T11:37:42.022394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-11T11:37:42.025724Z","title":"Autoregressive image generation without vec- tor quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.025724Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:6171f461bc6002a8fe4bfe0c39a69a5a60a4e1657083784fcca66bfe790dd325","observation_id":"ee3dcc74-d745-4c7e-864c-0a92866d13ff","resolution":{"observed_at":"2026-08-11T11:37:42.025724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01756","last_updated":"2024-12-03T20:32:52Z","snapshot_observed_at":"2026-07-31T17:12:13.287514Z","submitted_at":"2024-10-02T17:06:39Z","title":"ImageFolder: Autoregressive Image Generation with Folded Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01756","snapshot_observed_at":"2026-08-11T11:37:42.028863Z","title":"Imagefolder: Autoregres- sive image generation with folded tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.028863Z"},"links":{"cited_paper":"/paper/2410.01756","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:36d68704e7dbd1dc6349731f7aa1aaade174d46667ea002d923183ace58d9279","observation_id":"f2321931-1577-4967-8bc1-521a7293ab18","resolution":{"observed_at":"2026-08-11T11:37:42.028863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-11T11:37:42.031898Z","title":"Video-llava: Learning united visual rep- resentation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.031898Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:21b31c2163ddf52e98b736aba12d7e1515aa8ac216ab0b70c6f3912d147c3ec0","observation_id":"26180138-cf7f-4607-876f-22251b42a286","resolution":{"observed_at":"2026-08-11T11:37:42.031898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-11T04:49:22.222888Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-11T11:37:42.034923Z","title":"Open-sora plan: Open-source large video generation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.034923Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:88178388112311908f6387afb91eb7aaa94404cbd6be5b55c4e8f9b148bea413","observation_id":"2be723d2-c6a8-4e83-8fda-1b05bc489594","resolution":{"observed_at":"2026-08-11T11:37:42.034923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-11T11:37:42.038070Z","title":"Moe-llava: Mixture of experts for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.038070Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:d9051e82863823320fe4d0ee13b4d5bea80c9fb1eb713f0f08db988657b7dff7","observation_id":"97a851dc-b0f4-443f-b02f-9eefac836bd3","resolution":{"observed_at":"2026-08-11T11:37:42.038070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:42.041346Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.041346Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:ae593040d440cfe4e1e59592ed8faa7b3344d57f3382abb86d75019b3ce1664a","observation_id":"22e999eb-ce76-47a9-bdbf-cf7890f7e178","resolution":{"observed_at":"2026-08-11T11:37:42.041346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:42.044781Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.044781Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:2a8e814059d73a64d921e6b310a82104f8ecf196edf34fcc6015851207ce043c","observation_id":"222481ce-06b5-4bd8-b2a5-209fde848ae4","resolution":{"observed_at":"2026-08-11T11:37:42.044781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-11T11:37:42.047969Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.047969Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:a0ef421dd6a99af7dbb1551012d7e16c4260fcf0cad0debb15c8e35fce985dfc","observation_id":"1c079d4e-525b-46a4-bf3a-e520f7620d1d","resolution":{"observed_at":"2026-08-11T11:37:42.047969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17172","last_updated":"2023-12-28T17:57:06Z","snapshot_observed_at":"2026-08-01T22:57:31.468506Z","submitted_at":"2023-12-28T17:57:06Z","title":"Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17172","snapshot_observed_at":"2026-08-11T11:37:42.051512Z","title":"Unified-io 2: Scaling autoregressive mul- timodal models with vision, language, audio, and action","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.051512Z"},"links":{"cited_paper":"/paper/2312.17172","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:5c1f0413c656e1090caa7fb48d2fc039d9863c04e28569f911e6a963b22eac3e","observation_id":"ce4e3727-b7e0-45e7-b3ad-69a5353cf09e","resolution":{"observed_at":"2026-08-11T11:37:42.051512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-06T03:43:29.067278Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-11T11:37:42.055300Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual gener- ation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.055300Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:10e76d7e2751ca377b1e5b10c7e6ac45dbe1e101ec7729f593bd3f0bf0d9842c","observation_id":"d461c9b0-df8f-42f6-9589-d06f33176927","resolution":{"observed_at":"2026-08-11T11:37:42.055300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13013","last_updated":"2024-04-19T17:22:51Z","snapshot_observed_at":"2026-08-10T13:03:52.883055Z","submitted_at":"2024-04-19T17:22:51Z","title":"Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13013","snapshot_observed_at":"2026-08-11T11:37:42.058992Z","title":"Groma: Localized visual tokenization for grounding multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.058992Z"},"links":{"cited_paper":"/paper/2404.13013","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:62d6e709be1e06a047a468e71083f31355b6424f0494eafdcba5a8ad26ee6350","observation_id":"344f0e95-2292-46ac-8815-10bac8f8b852","resolution":{"observed_at":"2026-08-11T11:37:42.058992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:42.062549Z","title":"Janusflow: Harmonizing au- toregression and rectified flow for unified multimodal un- derstanding and generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.062549Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:694f4a1e08acb00f3776963de86598c2d872a863564f9edf3fbd96a64e72b70a","observation_id":"47e94fa9-10c3-407e-8be6-86889bdea2b1","resolution":{"observed_at":"2026-08-11T11:37:42.062549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:42.065960Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.065960Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:c46bce622860c5fb30895295eb8b1409f85f025cd1f01c952b5c75478484f418","observation_id":"747b278c-b834-4575-a2d4-2400aa666b9e","resolution":{"observed_at":"2026-08-11T11:37:42.065960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T11:37:42.069358Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.069358Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:a4742cdf20e456d82c027a098fcc0b9072fba2d2268e1434d54911ed9f1e9173","observation_id":"c5743155-79c4-4e45-9599-a06ecd2315ff","resolution":{"observed_at":"2026-08-11T11:37:42.069358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:42.072935Z","title":"Training lan- guage models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.072935Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:d3d8bb5c88cfea0c1aefbe5de94ba3578aa24175e7349f3267c1f49640fa2a4f","observation_id":"84bab1b5-fc09-4168-83d9-87a0911dd6ec","resolution":{"observed_at":"2026-08-11T11:37:42.072935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:42.076202Z","title":"Byte la- tent transformer: Patches scale better than tokens, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.076202Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:513f54a4f54e3ca648ef7e669269c29c6a8d0f22b43ce6d200e8943cd0bff850","observation_id":"be3b8a50-5726-48a0-aff9-e1c5cb954ada","resolution":{"observed_at":"2026-08-11T11:37:42.076202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01827","last_updated":"2025-07-08T00:51:16Z","snapshot_observed_at":"2026-08-12T16:02:34.405350Z","submitted_at":"2024-12-02T18:59:53Z","title":"RandAR: Decoder-only Autoregressive Visual Generation in Random Orders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01827","snapshot_observed_at":"2026-08-11T11:37:42.079502Z","title":"Freeman, and Yu-Xiong Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.079502Z"},"links":{"cited_paper":"/paper/2412.01827","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:65e3bb31c2dcec3efe0b9be67f170543eff62e5ce7cec447426f708db32dd6d9","observation_id":"010df9a7-dbe2-4bbc-b694-a159ce69c75c","resolution":{"observed_at":"2026-08-11T11:37:42.079502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:42.083216Z","title":"Scalable diffusion mod- els with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.083216Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:b78307f374131d741b4ec2888aea63a6034df97be3678ea4354f45c3b07aa715","observation_id":"84c08f94-ac3f-4a52-88ea-04485cccb29a","resolution":{"observed_at":"2026-08-11T11:37:42.083216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-11T11:37:42.086422Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.086422Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:1867725e2c618a74c7a1c3af1802fe1b7309f80d7ce9ec245389ce6ca1f4653f","observation_id":"352da051-374e-461e-9da2-fc27bd87d23e","resolution":{"observed_at":"2026-08-11T11:37:42.086422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-11T11:37:42.089803Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.089803Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:ab2b8fdbc4cc5eea35084feeca1013866de203e30633360b32d8612c39aa88b3","observation_id":"119419f8-3985-4d79-ba27-2728fd90e623","resolution":{"observed_at":"2026-08-11T11:37:42.089803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-08-11T22:45:59.824084Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-11T11:37:42.093550Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.093550Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:8f11cb484d5d0f65180ee9d5e99d136e005b297acdc3197cbe659b06960da02d","observation_id":"43d0d774-8cf4-4c06-babb-9e4c11199368","resolution":{"observed_at":"2026-08-11T11:37:42.093550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:42.097252Z","title":"Improving language understanding by gen- erative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.097252Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:f26283f15782efcc77b6bdb7d6b9e7c24e8c1de4569a0b4df4ccb07c9d1f4d7a","observation_id":"28c8210c-6b4f-46d9-80e9-58dba463fb9d","resolution":{"observed_at":"2026-08-11T11:37:42.097252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:42.100596Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.100596Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:b5b521198c503811d51ee8df192246249eebb135e52b55597812c1277b0e6fed","observation_id":"91d201b5-9dbd-4f3d-8109-145311e58c45","resolution":{"observed_at":"2026-08-11T11:37:42.100596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:42.103831Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.103831Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:0220b5d0d4f86c0ce98d2877b251bc3f01d77402bd5c8f7db7120b76bf7c116d","observation_id":"7d49ddf5-f181-468e-b9e1-08e9c62d1fd4","resolution":{"observed_at":"2026-08-11T11:37:42.103831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:42.107311Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.107311Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:31fb3426b355b8b2ecac9139189c9ebf9e7ee676d6a153799d44011f5580e6f8","observation_id":"95437200-fb32-4168-ad0a-d1eee3cff138","resolution":{"observed_at":"2026-08-11T11:37:42.107311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-11T11:37:42.110942Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.110942Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:c9fd89a28969b0facbeb1f7dc47ea79e842bcc1ddd49b41a2092b0693eaa49e8","observation_id":"8e7fb964-0b2c-4f56-80c8-37e24d39b611","resolution":{"observed_at":"2026-08-11T11:37:42.110942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:42.114916Z","title":"Gener- ating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.114916Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:4aed6a29f5d354d3e5454f9efc268c2d57afdad3afb4c7c5a7a28dbfe56111ec","observation_id":"230d4f1f-3548-4492-92cc-51894f39cb84","resolution":{"observed_at":"2026-08-11T11:37:42.114916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15205","last_updated":"2024-12-19T18:59:31Z","snapshot_observed_at":"2026-08-11T11:30:21.192058Z","submitted_at":"2024-12-19T18:59:31Z","title":"FlowAR: Scale-wise Autoregressive Image Generation Meets Flow Matching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15205","snapshot_observed_at":"2026-08-11T11:37:42.118172Z","title":"Flowar: Scale-wise au- toregressive image generation meets flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.118172Z"},"links":{"cited_paper":"/paper/2412.15205","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:2c4616f9dd0197d87e79f3c29592a07156a97db557e8db64d0df43653ebed65f","observation_id":"d1b46f05-cda0-43fb-a284-4eaa9070c5df","resolution":{"observed_at":"2026-08-11T11:37:42.118172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:42.121492Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.121492Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:f658125808f661a59db3f1ec7928d2eca8dff13d767d426ed429bee2d0366da7","observation_id":"c4cfca07-c8e9-4a6c-8ca5-064760d7897a","resolution":{"observed_at":"2026-08-11T11:37:42.121492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:42.124504Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.124504Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:8cfafddd891e455d462c328bae6b545e274f5380d2ccbbfbfb9ce52a2b0e22b7","observation_id":"39790062-eb6a-404d-acbc-20f8bd60ae56","resolution":{"observed_at":"2026-08-11T11:37:42.124504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:42.127401Z","title":"Improved techniques for training gans","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.127401Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:b641fd7e95a644c79290e94e33d1fff0a73addb107fad820bbfff5a0cc963199","observation_id":"9ea46b6f-7b70-435b-8c3a-d23e0c548708","resolution":{"observed_at":"2026-08-11T11:37:42.127401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:43.071074Z","title":"Stylegan- xl: Scaling stylegan to large diverse datasets","venue":null,"work_id":"35f3e574-d552-4973-a2b9-64a29796aafb","year":2022},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.130384Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:ad8387f8171f7b83069878af8181f4c74e8e96b240fbe1068efded19ed699a06","observation_id":"e75e3496-e8f0-4581-87dd-217dc28f34d4","resolution":{"observed_at":"2026-08-11T11:37:43.074724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12665","last_updated":"2025-05-15T05:15:13Z","snapshot_observed_at":"2026-08-11T13:57:33.657026Z","submitted_at":"2024-07-17T15:48:39Z","title":"Beyond Next Token Prediction: Patch-Level Training for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12665","snapshot_observed_at":"2026-08-11T11:37:42.133398Z","title":"Patch- level training for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.133398Z"},"links":{"cited_paper":"/paper/2407.12665","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:fb6212323837d05321a068f9bd45b6eb08bb605012363d4b678ddbf087933c4d","observation_id":"d7c9fc83-589a-4bb6-9318-afcfa41bd12e","resolution":{"observed_at":"2026-08-11T11:37:42.133398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02692","last_updated":"2025-03-10T09:01:48Z","snapshot_observed_at":"2026-08-12T11:16:32.406442Z","submitted_at":"2024-12-03T18:59:10Z","title":"Scalable Image Tokenization with Index Backpropagation Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02692","snapshot_observed_at":"2026-08-11T11:37:42.137388Z","title":"Taming scalable visual tok- enizer for autoregressive image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.137388Z"},"links":{"cited_paper":"/paper/2412.02692","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:42926121df6c331ee22e4969753be46b6eff1a97114e69c4dca553f495e0d9bf","observation_id":"e81aac83-706a-4d85-957a-9aaccec93474","resolution":{"observed_at":"2026-08-11T11:37:42.137388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-11T11:37:42.141135Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.141135Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:61cb5c87cd0d8802da90da76e1dcca33fe6e9989f53b2c26cc842f43b26c4411","observation_id":"b17f3eb0-7adb-44d8-9d91-04b679d818ce","resolution":{"observed_at":"2026-08-11T11:37:42.141135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:43.060257Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":"9e019106-6f03-49dd-89ec-7890c94d25c6","year":2019},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.144971Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:46175dd9a9fb4e0f5c1d802837c05c1eaca11b98d1561582ff497e162f7cf532","observation_id":"e3732777-565b-4398-96e2-6b4adfa0abb9","resolution":{"observed_at":"2026-08-11T11:37:43.064149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:43.049548Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":"50c7712c-041d-4e67-8450-b938457c7af7","year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.148225Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:c5ae9b172fea4713e309fb591a5df0bd9c6401a86b8e7706246c26d1c40d5651","observation_id":"60ee9139-fb02-49c9-a5e0-55456bcc2eb3","resolution":{"observed_at":"2026-08-11T11:37:43.053252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-11T11:37:42.151652Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.151652Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:bbdea281f8e0e26dd47be4a88f5b774322e51f9dfecaf913d10946a742b6d618","observation_id":"3c7429a4-bfe4-4359-81a3-67a4f62ccdfe","resolution":{"observed_at":"2026-08-11T11:37:42.151652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-11T11:37:42.158805Z","title":"Generative pretraining in mul- timodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.158805Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:6824e2f06fdcaed68cf89f94fa0e57ce31d17817c291ba199a74683a38dbf4b7","observation_id":"25e286b3-7cab-42b4-85d8-9b50c1fdb019","resolution":{"observed_at":"2026-08-11T11:37:42.158805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10812","last_updated":"2024-10-14T17:59:42Z","snapshot_observed_at":"2026-08-09T17:44:55.180658Z","submitted_at":"2024-10-14T17:59:42Z","title":"HART: Efficient Visual Generation with Hybrid Autoregressive Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10812","snapshot_observed_at":"2026-08-11T11:37:42.162071Z","title":"Hart: Efficient visual generation with hybrid autoregressive transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.162071Z"},"links":{"cited_paper":"/paper/2410.10812","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:5ab0bf1af6a2fa45b464c26b976ca65b103ead77963db5703ace7936f14fffa8","observation_id":"6556fe5e-a01b-4071-b3ea-089c1b9dca15","resolution":{"observed_at":"2026-08-11T11:37:42.162071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-11T11:37:42.166114Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.166114Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:cd5d888c859bb46af42fdf644aac5bcd0efb93e3f50199792a42e49a3f36295b","observation_id":"b67454dc-65b8-4ba6-a8bf-d428cfc0dbe1","resolution":{"observed_at":"2026-08-11T11:37:42.166114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T11:37:42.169547Z","title":"Gem- ini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.169547Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:b15715dfbc0fc44c80dc7b2b044809845792e1cdf01a246b728d476dfecaed19","observation_id":"e72a95e6-e806-4b7e-a280-142087eefdc2","resolution":{"observed_at":"2026-08-11T11:37:42.169547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:43.039084Z","title":"Internlm: A multilingual language model with progressively enhanced capabilities, 2023","venue":null,"work_id":"0f3da9f1-7730-41cb-b8c8-09f849eefa10","year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.173333Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:4792f19a0255f6758332408b0a523ee0a0b9a264151c011c475529b1a094c2e6","observation_id":"8a862b20-96f0-46d4-8832-7862484ffe40","resolution":{"observed_at":"2026-08-11T11:37:43.042849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08821","last_updated":"2024-12-15T21:20:12Z","snapshot_observed_at":"2026-08-12T00:14:10.196419Z","submitted_at":"2024-12-11T23:36:20Z","title":"Large Concept Models: Language Modeling in a Sentence Representation Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08821","snapshot_observed_at":"2026-08-11T11:37:42.176631Z","title":"Large concept models: Language mod- eling in a sentence representation space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.176631Z"},"links":{"cited_paper":"/paper/2412.08821","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:2d94b1409d8e0b83966b1b648a04adb0be6925a61fb1ef9ce233f57366657d0b","observation_id":"efce938b-7501-4164-9820-ccc8cea5c48f","resolution":{"observed_at":"2026-08-11T11:37:42.176631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-08-12T16:03:09.235570Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-11T11:37:42.180110Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.180110Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:6464b3a1c65aa75385652033d985f79d48a226702019fa2f215d46c056506db8","observation_id":"c1be90a2-340c-42e3-95ac-1d02a93b629d","resolution":{"observed_at":"2026-08-11T11:37:42.180110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:43.028798Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning, 2024","venue":null,"work_id":"14230e2d-77dc-4d23-bef8-b4f2326468ae","year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.183850Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:8552be4b3858bff5931696843d7bccd8f9aae90663f27bf8bc429ee0a7e63540","observation_id":"01591285-72fa-49cd-9248-628e800370d4","resolution":{"observed_at":"2026-08-11T11:37:43.032784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T11:37:42.187211Z","title":"Llama: Open and efficient foundation language mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.187211Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:2ee2994633c4e5186a6a60f88a0174bf4e9e3448664adcac43bc3ee464b4c0c7","observation_id":"9c3b8d69-2aa4-42ac-b238-7b0ef9964ab1","resolution":{"observed_at":"2026-08-11T11:37:42.187211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T11:37:42.190894Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.190894Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:58055dd83dcd428545776f0dbc6bec03985cac9cc5bda412522eb4195775606f","observation_id":"16b3cb20-640d-4926-b4f0-19045500349b","resolution":{"observed_at":"2026-08-11T11:37:42.190894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:43.018007Z","title":"Neural discrete representation learning","venue":null,"work_id":"490e9fd3-76ea-4d56-b17a-a5d785ad505e","year":2017},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.194543Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:a3049d1d6d3d601aa40bb9ccea9ff210b1e20133100b61ddb289b932760e1a78","observation_id":"706ce238-2539-4469-970a-39fc0e5693aa","resolution":{"observed_at":"2026-08-11T11:37:43.021678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:37:43.007322Z","title":"Attention is all you need","venue":null,"work_id":"dcaf1bef-87ba-4297-9cb5-b8cb8240f4eb","year":2017},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.197801Z"},"links":{"citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:645e8b78ecedd8662d262b94091c98b7f34a4fb8e6cd28c1d46512ab8ba8fc69","observation_id":"073051cf-b76e-409d-b11d-cb1567c6d097","resolution":{"observed_at":"2026-08-11T11:37:43.010880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T11:37:42.201149Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.201149Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:a3bd516428fc369fce4b1a598e1bb89210b0a9bb81d0db17b96e730d74bd7b45","observation_id":"b7dcabfc-5d01-435e-b835-f2bb60a781fd","resolution":{"observed_at":"2026-08-11T11:37:42.201149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-11T11:37:42.204639Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.204639Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:3abb1a37f38814efdca5c8acae58f0b530d95a2917344f1489c72770963175dd","observation_id":"78316c24-1984-437a-87a8-5911c83fe11d","resolution":{"observed_at":"2026-08-11T11:37:42.204639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15119","last_updated":"2025-04-03T02:34:24Z","snapshot_observed_at":"2026-08-11T15:19:38.404584Z","submitted_at":"2024-12-19T17:59:54Z","title":"Parallelized Autoregressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15119","snapshot_observed_at":"2026-08-11T11:37:42.208403Z","title":"Parallelized autoregressive visual genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.208403Z"},"links":{"cited_paper":"/paper/2412.15119","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:26e487475387b8170a5b1097304be37613438b862002365bc758fca702c8dc6c","observation_id":"1f8065e1-da55-4e18-932f-76ea0599a604","resolution":{"observed_at":"2026-08-11T11:37:42.208403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16211","last_updated":"2024-12-08T19:55:36Z","snapshot_observed_at":"2026-08-04T16:36:02.143481Z","submitted_at":"2024-09-24T16:12:12Z","title":"MaskBit: Embedding-free Image Generation via Bit Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16211","snapshot_observed_at":"2026-08-11T11:37:42.211813Z","title":"Maskbit: Embedding-free image generation via bit tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.211813Z"},"links":{"cited_paper":"/paper/2409.16211","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:e4fc09d7e4f2bec8797062e1a52b7697fb3f5a289544fe1b53064a7a9f057041","observation_id":"7afc6367-d954-4d82-9032-49ae7226e8f9","resolution":{"observed_at":"2026-08-11T11:37:42.211813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-11T11:37:42.215299Z","title":"Emer- gent abilities of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation","version":3},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-11T11:37:42.215299Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2412.15321"},"observation_digest":"sha256:e905784a6de685f1ad3e65ace2c88d048c8a1cd23abd95ab20c24627f8cca157","observation_id":"4541546c-a0c4-45cd-97ed-49ef68583e5d","resolution":{"observed_at":"2026-08-11T11:37:42.215299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.15321","last_updated":"2025-03-19T06:16:54Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T15:20:00.371059Z","submitted_at":"2024-12-19T18:59:36Z","title":"Next Patch Prediction for Autoregressive Visual Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":92,"verified_exact":1,"verified_fuzzy":7},"total_outbound_references":120},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 120 outbound references and 5 inbound Pith citation observations for arXiv:2412.15321."}