{"as_of":"2026-08-19T13:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97628047a2a7d7459392410779760d23d131b946c0712d21f468e8f162fcc4b9","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:26:02.330264Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.07999/citation-record","integrity":"/paper/2506.07999/integrity","json":"/paper/2506.07999/citation-record.json","paper":"/paper/2506.07999"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-08-17T05:51:02.087480Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-07T05:26:02.141730Z","title":"Denton, Seyed Kamyar Seyed Ghasemipour, Burcu Karagol Ayan, Seyedeh Sara Mahdavi, Raphael Gontijo Lopes, Tim Salimans, Jonathan Ho, David J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.141730Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:253d39c0ef5591d5f74b39b23e2a32f49ec0b6ff5bd53e6e51911378262a6891","observation_id":"544ef75f-082c-41c0-8402-9ca8daa351ab","resolution":{"observed_at":"2026-08-07T05:26:02.141730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:03.030454Z","title":"Semantic-conditional diffusion networks for image captioning*","venue":null,"work_id":"251626c2-fd8b-4a38-a7bc-366042252224","year":2023},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.148374Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:c4f679f27c4460d6fa119755288cc2388db22c5cfbd304e006a3da2be98bc0be","observation_id":"494bde0b-a381-4826-bc7e-74cc21da2b3b","resolution":{"observed_at":"2026-08-07T05:26:03.035305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:03.014788Z","title":"Metaxas, and S","venue":null,"work_id":"a28c7271-5c6a-4e12-8347-48bab1b0de75","year":2022},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.154536Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:f176437c240985da392d7a73d5caba63b799edc3af4c7f911996753a5d6bd4f4","observation_id":"7210748d-ffab-4ce4-84b6-868e679ba753","resolution":{"observed_at":"2026-08-07T05:26:03.019678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01827","last_updated":"2024-01-03T16:43:47Z","snapshot_observed_at":"2026-08-16T14:30:03.352541Z","submitted_at":"2024-01-03T16:43:47Z","title":"Moonshot: Towards Controllable Video Generation and Editing with Multimodal Conditions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01827","snapshot_observed_at":"2026-08-07T05:26:02.159306Z","title":"Moonshot: Towards controllable video generation and editing with multimodal conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.159306Z"},"links":{"cited_paper":"/paper/2401.01827","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:0f8c19c76194c9208e11f5bbfc4fee1bf89278ee04b0f0c31111ec1d10972c5d","observation_id":"4fa29346-b78e-407d-ba57-8d494f21b8e0","resolution":{"observed_at":"2026-08-07T05:26:02.159306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.998469Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"48db9997-ebca-4ddc-b886-b6bff30242a1","year":2021},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.164485Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:00141a08b046dbce1624aa5d178901cb7e5b4f17eae08f6b6234a7c3b1f33189","observation_id":"1acfa949-3647-486a-8f7a-3dcc41e3ac57","resolution":{"observed_at":"2026-08-07T05:26:03.003472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T05:26:02.169516Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.169516Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:4186b3494a360ef61e2855a895e10421a442d17a367bdc10f8ff5995956db2eb","observation_id":"a9af8c98-d79e-47ad-a980-60bd0d5c3382","resolution":{"observed_at":"2026-08-07T05:26:02.169516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-07T05:26:02.174857Z","title":"Cosmos world foundation model platform for physical ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.174857Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:51ad9b2a83a2d269836bdc2d548311e1fee3cd9481b7a654765b6c4de3b2faf4","observation_id":"e296f37f-7262-4e36-9ab5-699e0e348ad8","resolution":{"observed_at":"2026-08-07T05:26:02.174857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.982928Z","title":"Blattmann, Dominik Lorenz, Patrick Esser, and Bj \\\"o rn Ommer","venue":null,"work_id":"7b7f2ff8-a831-4494-b54c-46c5276cabf4","year":2022},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.179899Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:ebb3582f9a734071517ceadd87651c93250c3fc53594c780d60c200cd3084f0d","observation_id":"861fa5a2-c893-4650-8695-d3812e7ed8e9","resolution":{"observed_at":"2026-08-07T05:26:02.987674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.967793Z","title":"Peebles and Saining Xie","venue":null,"work_id":"b2190a56-02e3-41a5-8cd3-23c602049922","year":2023},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.184466Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:0775744460354ad701e5505043d4827263035ae726eedee7681bf9aebcbe4e52","observation_id":"40f1b01b-18b6-4358-a0fd-bcefc82a9227","resolution":{"observed_at":"2026-08-07T05:26:02.972644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-08-13T01:47:21.043519Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-07T05:26:02.189060Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.189060Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:cd57d58b938e8cf196eb6fbe7a7e61dabde978677453976818e27846e53fcb4a","observation_id":"9b1e849c-805a-457e-bf94-fd03f743576b","resolution":{"observed_at":"2026-08-07T05:26:02.189060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.950596Z","title":"Announcing the flux pro finetuning api","venue":null,"work_id":"5ac5b4ee-8013-44dd-a124-c70381714bfc","year":2025},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.195206Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:03f1bd817fcd88e9872260734e5f36d8f0a90d6a0b1e5dc04581b105dcd206c5","observation_id":"68056b33-8d3e-40df-834f-f1d5b816e72a","resolution":{"observed_at":"2026-08-07T05:26:02.956433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-08-16T13:42:07.461220Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-07T05:26:02.200117Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.200117Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:5438f4cb80343435fb1643f59196a3f518f32895e4e618554d4c7f689232893e","observation_id":"5f1e3e6b-773d-4c51-8945-3fe4e201cf36","resolution":{"observed_at":"2026-08-07T05:26:02.200117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.205671Z","title":"Acdit: Interpolating autoregressive conditional modeling and diffusion transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.205671Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:448af80ad9aa4a1ba5a442690a2fc21d43cb764d57177679b2b1be5c9fe326b2","observation_id":"c225a258-a4c0-40ad-ad33-589605391c9d","resolution":{"observed_at":"2026-08-07T05:26:02.205671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-19T12:50:53.888784Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-07T05:26:02.210366Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.210366Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:a502f170838459bc23f25f0437604b94b4f0e9c446e1a1577e897330af86a767","observation_id":"6fbc3b17-ad2e-44d7-8d58-a644b733a2a1","resolution":{"observed_at":"2026-08-07T05:26:02.210366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-08-18T17:34:44.890427Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T05:26:02.215293Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.215293Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:f8d744962281574db8394719e9f8f470fa529534a1a41be3e8db960eb423515e","observation_id":"efe7341d-83ae-420a-bc88-319e07ac5896","resolution":{"observed_at":"2026-08-07T05:26:02.215293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-08-10T05:21:27.485481Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-07T05:26:02.219967Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.219967Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:3bcbb5ecce75194550100f9a052645ae0fcae69b227576418468966f41431b58","observation_id":"a6927dc3-ef34-4fbc-beff-b841f147b555","resolution":{"observed_at":"2026-08-07T05:26:02.219967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.932902Z","title":"Neural discrete representation learning","venue":null,"work_id":"dd4a4550-5502-4f03-8d89-42e6d89a3829","year":2017},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.224761Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:2e8d3bec267ee20e8017a9d449f565bbb0c5838ba7ea816927c504ab2de3d362","observation_id":"592032d5-4885-454e-9b6a-b31df77da8b3","resolution":{"observed_at":"2026-08-07T05:26:02.938173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-07T05:26:02.229503Z","title":"Minnen, Eirikur Agustsson, and Michael Tschannen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.229503Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:ab2ec76ffa69d02fc2aa8f17fa39c00f59483e1c7e430b845fc543342bc0e17b","observation_id":"52069c2e-0ba9-437b-8cac-ff9b27c1b071","resolution":{"observed_at":"2026-08-07T05:26:02.229503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.916726Z","title":"Minnen, Yong Cheng, Agrim Gupta, Xiuye Gu, Alexander G","venue":null,"work_id":"05176f95-aef7-42ec-8ad0-c9daef426363","year":2023},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.235441Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:493502c2a03511cba8c276c7ede335a6f78ed901a64e32a0a3fbe75b1c62fb28","observation_id":"fbaad28b-6672-4741-97a4-0bfbedee047a","resolution":{"observed_at":"2026-08-07T05:26:02.921578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02116","last_updated":"2024-07-17T16:32:09Z","snapshot_observed_at":"2026-08-16T14:37:45.753685Z","submitted_at":"2023-12-04T18:48:02Z","title":"GIVT: Generative Infinite-Vocabulary Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02116","snapshot_observed_at":"2026-08-07T05:26:02.240085Z","title":"Givt: Generative infinite-vocabulary transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.240085Z"},"links":{"cited_paper":"/paper/2312.02116","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:aaf30d71d97263038ffe5057f675babeeadc7edee30b57b8d7241d3054480f20","observation_id":"1d12df17-efb9-41c9-8cea-fa22c4d26da0","resolution":{"observed_at":"2026-08-07T05:26:02.240085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-17T03:15:27.866249Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-07T05:26:02.245217Z","title":"Zettlemoyer, and Lili Yu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.245217Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:116d2ed4646adc012427a8be47a6cf5695332f3ae0bf5207a5a36a4ef63c30ba","observation_id":"58e5e446-5684-49ed-a9fb-a57566674917","resolution":{"observed_at":"2026-08-07T05:26:02.245217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T05:26:02.250162Z","title":"Hartshorn, Aobo Yang, Archi Mitra, and Archie Sravankumar et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.250162Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:4cf73f3eac271493e61de8c0ea2fc1fd164f70003cd63a474f00b95f8fe5ad19","observation_id":"bd83759b-6a84-4ff7-9ff3-95f419ceca7e","resolution":{"observed_at":"2026-08-07T05:26:02.250162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09672","last_updated":"2021-02-18T23:44:17Z","snapshot_observed_at":"2026-08-17T08:18:36.930250Z","submitted_at":"2021-02-18T23:44:17Z","title":"Improved Denoising Diffusion Probabilistic Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09672","snapshot_observed_at":"2026-08-07T05:26:02.255039Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.255039Z"},"links":{"cited_paper":"/paper/2102.09672","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:97b8662cf6af9927fea9cafd24b0900e692a769c0d22037ec5a4cff353e44da5","observation_id":"f8e9cff5-7b83-49e2-8c18-1caf4883be3c","resolution":{"observed_at":"2026-08-07T05:26:02.255039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04996","last_updated":"2025-05-08T01:53:55Z","snapshot_observed_at":"2026-08-14T02:18:08.215462Z","submitted_at":"2024-11-07T18:59:06Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04996","snapshot_observed_at":"2026-08-07T05:26:02.259935Z","title":"Zettlemoyer, and Xi Victoria Lin","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.259935Z"},"links":{"cited_paper":"/paper/2411.04996","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:24c8b36869df16228a6eec30090fe03dd57e93ae54139f39878d2a25fe4c69f5","observation_id":"4fba9174-df27-40ef-a29b-901eeec878d1","resolution":{"observed_at":"2026-08-07T05:26:02.259935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05496","last_updated":"2024-12-07T01:46:38Z","snapshot_observed_at":"2026-08-14T20:35:19.337789Z","submitted_at":"2024-12-07T01:46:38Z","title":"Flex Attention: A Programming Model for Generating Optimized Attention Kernels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05496","snapshot_observed_at":"2026-08-07T05:26:02.265059Z","title":"Flex attention: A programming model for generating optimized attention kernels","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.265059Z"},"links":{"cited_paper":"/paper/2412.05496","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:87fd68e9ae98a64b4ddbfa8f70c1e6393ec1784ee5eca7ee2ad1fa44e7b0d5fd","observation_id":"b1c20c57-3a1e-4fa7-ad98-4618190b6905","resolution":{"observed_at":"2026-08-07T05:26:02.265059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-08-12T01:14:44.484432Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-07T05:26:02.270330Z","title":"Progressive distillation for fast sampling of diffusion models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.270330Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:e4e26f6f3c836e8fe7ed2cfc3cca097a9e455a82a724dc9b7256ee89c5c1f0b2","observation_id":"4db2e591-13d1-4e93-93a7-dde297427fd4","resolution":{"observed_at":"2026-08-07T05:26:02.270330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.900174Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":"5115cf88-9784-4c6c-91ba-7eaa5be7a0a2","year":2019},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.275413Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:35a895ac175b9676b352a200d79b11576aa0e847faaf8c4dbe125a2bb80ff8ed","observation_id":"62d869dd-57ac-48be-966f-c3e3d4421037","resolution":{"observed_at":"2026-08-07T05:26:02.905182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.280007Z","title":"Berg, and Li Fei-Fei","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.280007Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:e7f823b1832fbd404cc718fa15031c8eb479108f0094fb2e1b99433117ab43dc","observation_id":"dec8887e-146a-497a-9fcb-531037e4a453","resolution":{"observed_at":"2026-08-07T05:26:02.280007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08500","last_updated":"2018-01-12T14:05:44Z","snapshot_observed_at":"2026-08-14T20:51:33.836666Z","submitted_at":"2017-06-26T17:45:23Z","title":"GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08500","snapshot_observed_at":"2026-08-07T05:26:02.284927Z","title":"Gans trained by a two time-scale update rule converge to a nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.284927Z"},"links":{"cited_paper":"/paper/1706.08500","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:20841ac9bf5ebba6658fccf1157192850e504e9705b5070f51d5442a120d64ac","observation_id":"e2b7d0af-685f-409a-9696-75ee733aa485","resolution":{"observed_at":"2026-08-07T05:26:02.284927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T05:26:02.290423Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.290423Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:45fa7d7a4386b20a1f95a6efca932850b14da792f3635fafa8113aa1a5f6e75b","observation_id":"b359263d-7854-4482-bff0-19015f64197b","resolution":{"observed_at":"2026-08-07T05:26:02.290423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T05:26:02.295862Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.295862Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:a832697aebe5cdb43797b233944922beb558c67c47f34355cbc128e46190c3cd","observation_id":"87f949b3-56af-4d57-b1b8-c37f3b2ffbad","resolution":{"observed_at":"2026-08-07T05:26:02.295862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16280","last_updated":"2024-09-24T17:51:04Z","snapshot_observed_at":"2026-08-16T13:15:46.020505Z","submitted_at":"2024-09-24T17:51:04Z","title":"MonoFormer: One Transformer for Both Diffusion and Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16280","snapshot_observed_at":"2026-08-07T05:26:02.300549Z","title":"Monoformer: One transformer for both diffusion and autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.300549Z"},"links":{"cited_paper":"/paper/2409.16280","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:0826b3cd9192b6319ca5d2136ace51598e7fc33cfd2630161e4f5c66ec6cfc9a","observation_id":"69d98c81-9564-48fe-8a07-aeefee81b03d","resolution":{"observed_at":"2026-08-07T05:26:02.300549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08635","last_updated":"2024-12-11T18:57:32Z","snapshot_observed_at":"2026-08-16T13:00:15.419884Z","submitted_at":"2024-12-11T18:57:32Z","title":"Multimodal Latent Language Modeling with Next-Token Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08635","snapshot_observed_at":"2026-08-07T05:26:02.305545Z","title":"Multimodal latent language modeling with next-token diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.305545Z"},"links":{"cited_paper":"/paper/2412.08635","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:d4b3142af1aec3d3c779f2f2b4fd58ae67e5706f5a9eb4ea0b0a324ae205a3e9","observation_id":"c019fe1d-5e97-499b-8135-b37cb455203b","resolution":{"observed_at":"2026-08-07T05:26:02.305545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-08-18T00:29:51.878457Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-07T05:26:02.310361Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.310361Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:0fa5ae1d2aefd839ebdf58bdbfef4fca07baedb2fdefb20f4f8a726679ebfe75","observation_id":"446505ae-d8ab-4536-8a30-77cdf3a0a24c","resolution":{"observed_at":"2026-08-07T05:26:02.310361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.879905Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision, language, audio, and action","venue":null,"work_id":"0f30a08f-22ba-43a2-b985-d4c5b84c7fed","year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.315361Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:fb8e020eab5489e3fdf5e506669322c78273ee957eaa141c725c542476fee6f9","observation_id":"736137f4-926f-4033-9fb4-1590dd309969","resolution":{"observed_at":"2026-08-07T05:26:02.887324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:02.860422Z","title":"Addendum to gpt-4o system card: Native image generation, 2025","venue":null,"work_id":"ff1c26ce-ca08-4310-8cbd-de55f0833302","year":2025},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.320633Z"},"links":{"citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:f1aeb7700b56a267f36251c2de9cb62b66308d9c9275a7b41b89d51b14434f17","observation_id":"d9adef13-b6d4-4578-a126-2b3c99bbc6c7","resolution":{"observed_at":"2026-08-07T05:26:02.867367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-08-16T14:03:52.109479Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-07T05:26:02.325132Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.325132Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:4dc32ea16c8e2337c040f82b4f148bcc7bc106b6380656ad4a3608dd2feb6673","observation_id":"5a82c5ce-1d22-45c3-b8f0-cae910510371","resolution":{"observed_at":"2026-08-07T05:26:02.325132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10812","last_updated":"2024-10-14T17:59:42Z","snapshot_observed_at":"2026-08-16T13:09:29.086289Z","submitted_at":"2024-10-14T17:59:42Z","title":"HART: Efficient Visual Generation with Hybrid Autoregressive Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10812","snapshot_observed_at":"2026-08-07T05:26:02.330264Z","title":"Hart: Efficient visual generation with hybrid autoregressive transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.330264Z"},"links":{"cited_paper":"/paper/2410.10812","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:379359182ca623ebe56cfe73df3bba293a5bf722d5a98c2e7fae9d9b098b411f","observation_id":"7afd44aa-38ce-4c14-996a-5b623d8e2a32","resolution":{"observed_at":"2026-08-07T05:26:02.330264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T05:27:02.504678Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2506.07999."}