{"as_of":"2026-08-09T11:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c21b7df94284797f7ec6fda1c4d314ea17d3bfb9e199a08e808ce6a01c8243e","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T04:47:30.494924Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:12:35.779135Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:50:11.463918Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03444","snapshot_observed_at":"2026-08-07T13:12:35.779135Z","title":"Masked autoencoders are effective tokenizers for diffusion models.arXiv preprint arXiv:2502.03444, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22391","last_updated":"2026-06-29T10:56:31Z","snapshot_observed_at":"2026-08-09T04:34:17.669891Z","submitted_at":"2025-05-28T14:17:58Z","title":"Physics-Informed Distillation of Diffusion Models for PDE-Constrained Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:35.779135Z"},"links":{"cited_paper":"/paper/2502.03444","citing_paper":"/paper/2505.22391"},"observation_digest":"sha256:6742997d806b9a3c2dd4ea3668056932ce692517b82a678d4657e98e25c3d7c6","observation_id":"09e89c9d-4461-4f07-b14a-1ef1dc47bfe1","resolution":{"observed_at":"2026-08-07T13:12:35.779135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03444","snapshot_observed_at":"2026-08-06T23:28:32.384911Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models ,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18270","last_updated":"2025-06-23T03:54:53Z","snapshot_observed_at":"2026-08-09T07:59:35.568689Z","submitted_at":"2025-06-23T03:54:53Z","title":"Adaptive Mask-guided K-space Diffusion for Accelerated MRI Reconstruction","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:32.384911Z"},"links":{"cited_paper":"/paper/2502.03444","citing_paper":"/paper/2506.18270"},"observation_digest":"sha256:1a31babbba2d348c47ec50a18b5d924913a5da3d2df96367c290886c76e65e38","observation_id":"fc96ed1b-a237-4583-bd10-bb1af9f6da46","resolution":{"observed_at":"2026-08-06T23:28:32.384911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03444","snapshot_observed_at":"2026-08-06T19:41:23.628002Z","title":"Masked autoencoders are effective tokenizers for diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04947","last_updated":"2025-07-07T12:45:23Z","snapshot_observed_at":"2026-08-08T12:12:25.015685Z","submitted_at":"2025-07-07T12:45:23Z","title":"DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:23.628002Z"},"links":{"cited_paper":"/paper/2502.03444","citing_paper":"/paper/2507.04947"},"observation_digest":"sha256:b72c427e481fcd567194d272f3ae160409f8c97e3d52421b13c708a592fc500a","observation_id":"137e2f05-51d3-4712-84a0-7b96c1511d17","resolution":{"observed_at":"2026-08-06T19:41:23.628002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"cited_work":{"arxiv_id":"2502.03444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03444","snapshot_observed_at":"2026-07-04T20:50:11.463918Z","title":"Masked autoencoders are effective tokenizers for diffusion models.ArXiv, abs/2502.03444","venue":null,"work_id":"796bad85-d3e2-4321-8fa5-83fb720de614","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2502.03444","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:c54521af78189a48a58c7ad6fe1648814081fac175ec80c4c8bed0da18a01ea7","observation_id":"c09e4615-7060-4e87-b943-575ace00a510","resolution":{"observed_at":"2026-05-11T21:51:11.648909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"cited_work":{"arxiv_id":"2502.03444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03444","snapshot_observed_at":"2026-07-04T20:50:11.463918Z","title":"Masked autoencoders are effective tokenizers for diffusion models.ArXiv, abs/2502.03444","venue":null,"work_id":"796bad85-d3e2-4321-8fa5-83fb720de614","year":2025},"citing_paper":{"arxiv_id":"2605.07915","last_updated":"2026-05-08T15:52:51Z","snapshot_observed_at":"2026-08-02T05:37:32.685801Z","submitted_at":"2026-05-08T15:52:51Z","title":"What Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent Diffusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T01:57:24.033068Z"},"links":{"cited_paper":"/paper/2502.03444","citing_paper":"/paper/2605.07915"},"observation_digest":"sha256:bf46d23ab2b37d60a02d24cd46f15fd3443edc165e8c1cd5e2459e902ab76945","observation_id":"f8443c64-a3fa-43e1-811f-321cf04f6d35","resolution":{"observed_at":"2026-05-11T04:05:57.608936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"cited_work":{"arxiv_id":"2502.03444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03444","snapshot_observed_at":"2026-07-04T20:50:11.463918Z","title":"Masked autoencoders are effective tokenizers for diffusion models.ArXiv, abs/2502.03444","venue":null,"work_id":"796bad85-d3e2-4321-8fa5-83fb720de614","year":2025},"citing_paper":{"arxiv_id":"2605.27696","last_updated":"2026-05-28T13:12:21Z","snapshot_observed_at":"2026-07-06T23:37:21.716437Z","submitted_at":"2026-05-26T21:16:04Z","title":"Structure over Pixels: Learning Variable-Length Visual Programs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T18:06:01.684713Z"},"links":{"cited_paper":"/paper/2502.03444","citing_paper":"/paper/2605.27696"},"observation_digest":"sha256:f84581239042488cbefcb9e76c95af3607ac087b93ea9350c2861f501ca67945","observation_id":"3f86571b-014d-4824-af0c-f2585530ecbe","resolution":{"observed_at":"2026-06-29T18:13:49.025604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"cited_work":{"arxiv_id":"2502.03444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03444","snapshot_observed_at":"2026-07-04T20:50:11.463918Z","title":"Masked autoencoders are effective tokenizers for diffusion models.ArXiv, abs/2502.03444","venue":null,"work_id":"796bad85-d3e2-4321-8fa5-83fb720de614","year":2025},"citing_paper":{"arxiv_id":"2606.19651","last_updated":"2026-07-28T21:02:23Z","snapshot_observed_at":"2026-08-07T19:27:55.015113Z","submitted_at":"2026-06-17T23:14:16Z","title":"BrainG3N: A Dual-Purpose Tokenizer for Controllable 3D Brain MRI Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T20:29:00.314097Z"},"links":{"cited_paper":"/paper/2502.03444","citing_paper":"/paper/2606.19651"},"observation_digest":"sha256:b58abc03e607875a51d619ffe3e11e7da19a2c703cbe183b2a16795a8c8af759","observation_id":"6ab563c2-edc8-4d08-a21e-3afb9d76a152","resolution":{"observed_at":"2026-07-04T01:19:21.135295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03444","snapshot_observed_at":"2026-08-02T10:53:54.467279Z","title":"Masked autoencoders are effective tokenizers for diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19651","last_updated":"2026-07-28T21:02:23Z","snapshot_observed_at":"2026-08-07T19:27:55.015113Z","submitted_at":"2026-06-17T23:14:16Z","title":"BrainG3N: A Dual-Purpose Tokenizer for Controllable 3D Brain MRI Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T10:53:54.467279Z"},"links":{"cited_paper":"/paper/2502.03444","citing_paper":"/paper/2606.19651"},"observation_digest":"sha256:850c02135ac8ee1b172903efa62a3449cfbb72e9ed09e440a8031d8439e29494","observation_id":"5bc0004d-beb8-490a-84fe-e00b9c9924c4","resolution":{"observed_at":"2026-08-02T10:53:54.467279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"cited_work":{"arxiv_id":"2502.03444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03444","snapshot_observed_at":"2026-07-04T20:50:11.463918Z","title":"Masked autoencoders are effective tokenizers for diffusion models.ArXiv, abs/2502.03444","venue":null,"work_id":"796bad85-d3e2-4321-8fa5-83fb720de614","year":2025},"citing_paper":{"arxiv_id":"2606.26016","last_updated":"2026-07-08T10:57:01Z","snapshot_observed_at":"2026-08-02T07:36:10.167129Z","submitted_at":"2026-06-24T16:37:10Z","title":"MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-25T19:34:02.046104Z"},"links":{"cited_paper":"/paper/2502.03444","citing_paper":"/paper/2606.26016"},"observation_digest":"sha256:73451b9834d9cdb524c07f77d231a8e7af85e1783829c477d3b71dee4363fe36","observation_id":"ab64295f-cce5-480c-a75a-0eaca0356265","resolution":{"observed_at":"2026-07-04T20:50:11.467934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.03444/citation-record","integrity":"/paper/2502.03444/integrity","json":"/paper/2502.03444/citation-record.json","paper":"/paper/2502.03444"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.08070","last_updated":"2024-09-12T04:39:16Z","snapshot_observed_at":"2026-07-06T18:29:30.075334Z","submitted_at":"2024-06-12T10:40:10Z","title":"CFG++: Manifold-constrained Classifier Free Guidance for Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08070","snapshot_observed_at":"2026-08-09T04:47:30.300523Z","title":"Y ., Nam, H., and Ye, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.300523Z"},"links":{"cited_paper":"/paper/2406.08070","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:8c194bfbceb233a0e3abb62b3308bd33f90a4d70536671dac54aa49a209b286f","observation_id":"6d312cda-e11e-46ca-abe5-7d6bb89f6774","resolution":{"observed_at":"2026-08-09T04:47:30.300523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:47:31.347696Z","title":"We use a classifier-free guidance scale of 2.0","venue":null,"work_id":"8b2ac61d-5933-4c4d-b829-6580e13381d8","year":2023},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.471173Z"},"links":{"citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:95e086a3295eac322fd2307f2d1cb9847255c1e0905d5c27e9205ab927e5cc3b","observation_id":"315e1a6b-2f5c-467e-9166-774844a93d46","resolution":{"observed_at":"2026-08-09T04:47:31.353123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:47:30.315643Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.315643Z"},"links":{"citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:98b1d3c2fc80e14b35104cdf58d3eb3b0ecd18325b8141a283dbddc2216c3fe2","observation_id":"c320df9f-cd57-4c37-a478-7d707f9ab734","resolution":{"observed_at":"2026-08-09T04:47:30.315643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14389","last_updated":"2024-02-21T15:45:20Z","snapshot_observed_at":"2026-07-06T15:07:52.629778Z","submitted_at":"2023-03-25T07:47:21Z","title":"MDTv2: Masked Diffusion Transformer is a Strong Image Synthesizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14389","snapshot_observed_at":"2026-08-09T04:47:30.325347Z","title":"Mdtv2: Masked diffusion transformer is a strong image synthe- sizer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.325347Z"},"links":{"cited_paper":"/paper/2303.14389","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:9839c553f9b6166aa6512932066c850a1f0515b56b28c7e0deacb4c4f8b22dca","observation_id":"9abfc1e2-5d1f-4142-a911-d84939b87c1a","resolution":{"observed_at":"2026-08-09T04:47:30.325347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18869","last_updated":"2025-03-04T15:36:34Z","snapshot_observed_at":"2026-07-06T18:07:10.639325Z","submitted_at":"2024-04-29T17:00:20Z","title":"Learning Mixtures of Gaussians Using Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18869","snapshot_observed_at":"2026-08-09T04:47:30.330316Z","title":"Learning mixtures of gaussians using diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.330316Z"},"links":{"cited_paper":"/paper/2404.18869","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:10504c66b143994897e524487a638e466de06fe05c94d3158ed8be2f435486fc","observation_id":"9fd820e9-6c9f-4c1d-ab9b-dc06f0d92388","resolution":{"observed_at":"2026-08-09T04:47:30.330316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03185","last_updated":"2023-03-09T09:59:43Z","snapshot_observed_at":"2026-08-09T09:59:59.902935Z","submitted_at":"2022-12-06T17:58:38Z","title":"Rethinking the Objectives of Vector-Quantized Tokenizers for Image Synthesis","version":2},"cited_work":{"arxiv_id":"2212.03185","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.03185","snapshot_observed_at":"2026-08-09T04:47:31.129267Z","title":"Rethinking the Objectives of Vector-Quantized Tokenizers for Image Synthesis","venue":"cs.CV","work_id":"16d447bc-5bfa-4d24-9399-feeea97c5bc3","year":2022},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.334536Z"},"links":{"cited_paper":"/paper/2212.03185","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:da2e04d8648fa5121dec485bca1dd7bf2896eb3868f3a9a7c54fff873a57f6e6","observation_id":"34a3c264-4b60-4807-8bb5-2c4553194f57","resolution":{"observed_at":"2026-08-09T04:47:31.134178Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-09T04:47:30.352649Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.352649Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:f24913d302fbd71047296120293fe9bbdcca0fbbdd7c72c187855fa4f537a902","observation_id":"ef981338-a86b-4db4-a4ba-fe029231fdfb","resolution":{"observed_at":"2026-08-09T04:47:30.352649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07724","last_updated":"2024-11-06T14:29:36Z","snapshot_observed_at":"2026-07-06T17:58:47.786948Z","submitted_at":"2024-04-11T13:16:47Z","title":"Applying Guidance in a Limited Interval Improves Sample and Distribution Quality in Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07724","snapshot_observed_at":"2026-08-09T04:47:30.357328Z","title":"Applying guidance in a limited interval improves sample and distribution quality in diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.357328Z"},"links":{"cited_paper":"/paper/2404.07724","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:8ec4cfa82c87a5c38453ee07b7eb63d76b65a020247aceeec923ce99a308c362","observation_id":"3659ef7d-8169-4307-be1f-38c83d87caef","resolution":{"observed_at":"2026-08-09T04:47:30.357328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:47:30.362139Z","title":"Scalable autoregressive image generation with mamba","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.362139Z"},"links":{"citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:54c59f19431d9b96967f5433db0d88dc3fe66b8b2935b5811c4a26cded7a176f","observation_id":"ca61901c-c8ed-4221-8b40-163581a829ae","resolution":{"observed_at":"2026-08-09T04:47:30.362139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09117","last_updated":"2023-06-29T15:30:25Z","snapshot_observed_at":"2026-08-09T11:11:48.988639Z","submitted_at":"2022-11-16T18:59:02Z","title":"MAGE: MAsked Generative Encoder to Unify Representation Learning and Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09117","snapshot_observed_at":"2026-08-09T04:47:30.366749Z","title":"Li, T., Tian, Y ., Li, H., Deng, M., and He, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.366749Z"},"links":{"cited_paper":"/paper/2211.09117","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:bf2a082305f1df321fa5eae27db81f7b85b7bec2a9633e6577c8b53bd45034b3","observation_id":"88c84e75-e3bf-4e02-9c0d-9be1286d50b3","resolution":{"observed_at":"2026-08-09T04:47:30.366749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-09T04:47:30.376382Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.376382Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:788639a26a511b4455ab85e6ef328647526d3fc2bfcb571a66aad9edfaa3eb6b","observation_id":"053c4ca8-c933-48e5-b03b-5a8c7e27cd38","resolution":{"observed_at":"2026-08-09T04:47:30.376382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03426","last_updated":"2020-09-18T01:56:41Z","snapshot_observed_at":"2026-08-02T15:32:07.466568Z","submitted_at":"2018-02-09T19:39:33Z","title":"UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.03426","snapshot_observed_at":"2026-08-09T04:47:30.385806Z","title":"Umap: Uniform manifold approximation and projection for dimension reduction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.385806Z"},"links":{"cited_paper":"/paper/1802.03426","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:f2453f9007010bda916ad761cde9f9d8b1fface08b573ffc5fa9d7430c852606","observation_id":"0a433903-6052-4c93-b615-41bf8acf14fb","resolution":{"observed_at":"2026-08-09T04:47:30.385806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09672","last_updated":"2021-02-18T23:44:17Z","snapshot_observed_at":"2026-08-06T00:36:41.660457Z","submitted_at":"2021-02-18T23:44:17Z","title":"Improved Denoising Diffusion Probabilistic Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09672","snapshot_observed_at":"2026-08-09T04:47:30.390516Z","title":"org/abs/2102.09672","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.390516Z"},"links":{"cited_paper":"/paper/2102.09672","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:6bb545cc57b4e425ac7942cfdb46affdf54df935ea801ab24efbbd64ef35c33d","observation_id":"2ee4a99d-0bbd-494a-9b1a-e028a53457a1","resolution":{"observed_at":"2026-08-09T04:47:30.390516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-09T04:47:30.395192Z","title":"Qiu, K., Li, X., Kuen, J., Chen, H., Xu, X., Gu, J., Luo, Y ., Raj, B., Lin, Z., and Savvides, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.395192Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:ccc5c62245f0a9ae4a1c54890cfeacafb3c575dc2e636b48c6375cacd938771a","observation_id":"1676abbe-ba08-44e0-820a-fb3536d78cfd","resolution":{"observed_at":"2026-08-09T04:47:30.395192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-07-06T20:01:23.373458Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-09T04:47:30.399979Z","title":"K., Yuan, Z., and Wu, X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.399979Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:68dec9ab69a6184852b281e96cc39e57eb4115be315311cba2086422ff46aa2f","observation_id":"bfbc628b-1402-4466-848a-af856d58595a","resolution":{"observed_at":"2026-08-09T04:47:30.399979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00446","last_updated":"2019-06-02T16:46:42Z","snapshot_observed_at":"2026-08-04T16:17:18.141333Z","submitted_at":"2019-06-02T16:46:42Z","title":"Generating Diverse High-Fidelity Images with VQ-VAE-2","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00446","snapshot_observed_at":"2026-08-09T04:47:30.404988Z","title":"Generating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.404988Z"},"links":{"cited_paper":"/paper/1906.00446","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:bb64d009aab726b91fc684e9baa5e802dc30ca823fe7f5d63f98e4400e8c5bf5","observation_id":"2be2b9d3-15af-4ebb-b77f-ac0de51c7674","resolution":{"observed_at":"2026-08-09T04:47:30.404988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.03585","last_updated":"2015-11-18T21:50:51Z","snapshot_observed_at":"2026-07-06T04:11:47.439779Z","submitted_at":"2015-03-12T04:51:37Z","title":"Deep Unsupervised Learning using Nonequilibrium Thermodynamics","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.03585","snapshot_observed_at":"2026-08-09T04:47:30.410224Z","title":"Deep unsupervised learning using nonequi- librium thermodynamics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.410224Z"},"links":{"cited_paper":"/paper/1503.03585","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:017a587e8cf68d2ab82108995e52c552b5831accedc89987ea409aca9818ac41","observation_id":"0c90efcd-9360-477c-823a-011764809218","resolution":{"observed_at":"2026-08-09T04:47:30.410224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-09T04:47:30.415234Z","title":"Sun, P., Jiang, Y ., Chen, S., Zhang, S., Peng, B., Luo, P., and Yuan, Z","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.415234Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:6c660fea2c002c3a0fe2bba28e31e7d00af3061fde68f38f8aea284a34f03f7a","observation_id":"7845f076-7985-4bf3-b12a-2c0f6a261ec7","resolution":{"observed_at":"2026-08-09T04:47:30.415234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-09T04:47:30.420636Z","title":"org/abs/2404.02905","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.420636Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:dfb95cead5c680e180ccc6d62d414f361c2d5eaa75ce97d9f8f45fdf99167eea","observation_id":"0042ac06-01d5-435c-9301-8887c412a26f","resolution":{"observed_at":"2026-08-09T04:47:30.420636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03310","last_updated":"2021-04-07T17:59:06Z","snapshot_observed_at":"2026-08-04T04:32:35.496518Z","submitted_at":"2021-04-07T17:59:06Z","title":"Regularizing Generative Adversarial Networks under Limited Data","version":1},"cited_work":{"arxiv_id":"2104.03310","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.03310","snapshot_observed_at":"2026-08-09T04:47:30.665104Z","title":"Regularizing Generative Adversarial Networks under Limited Data","venue":"cs.LG","work_id":"f5c73b3c-8c49-49d2-96f7-463cfc4dfd03","year":2021},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.425246Z"},"links":{"cited_paper":"/paper/2104.03310","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:fe3f7c501382b142a53a18d1097843c2bc6814f3b934eb74577f37d300633eca","observation_id":"3ae13516-c185-4215-a967-7403ede333d0","resolution":{"observed_at":"2026-08-09T04:47:30.672090Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05931","last_updated":"2021-12-02T05:34:23Z","snapshot_observed_at":"2026-07-06T11:18:06.306116Z","submitted_at":"2021-06-10T17:26:35Z","title":"Score-based Generative Modeling in Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05931","snapshot_observed_at":"2026-08-09T04:47:30.429558Z","title":"org/abs/2106.05931","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.429558Z"},"links":{"cited_paper":"/paper/2106.05931","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:0fc5cdc88d2b37ca3501c012909e9b0bf1aee38cf8599f6dac0998bd30c9f68d","observation_id":"9c516e76-6e6f-4fdd-b728-951fc1a6e7c9","resolution":{"observed_at":"2026-08-09T04:47:30.429558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-09T04:47:30.433779Z","title":"Vincent, P., Larochelle, H., Bengio, Y ., and Manzagol, P.-A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.433779Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:2c528cd993b59cf752e089ce459781666b26f3524aeb5165d968fe6b03b8cb82","observation_id":"f7d35cb9-8cda-4fba-b775-fdecb24ba814","resolution":{"observed_at":"2026-08-09T04:47:30.433779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-09T04:47:30.442646Z","title":"Vila-u: a unified foundation model integrating visual understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.442646Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:14aa0c7d8423886e5b78982bdbd38df75a5aa68047386d71112d3acff4391e9b","observation_id":"9bdb1c11-5e51-44e8-889d-93ead04943f4","resolution":{"observed_at":"2026-08-09T04:47:30.442646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01423","last_updated":"2025-03-10T11:43:42Z","snapshot_observed_at":"2026-08-06T01:13:01.484290Z","submitted_at":"2025-01-02T18:59:40Z","title":"Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01423","snapshot_observed_at":"2026-08-09T04:47:30.447243Z","title":"and Wang, X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.447243Z"},"links":{"cited_paper":"/paper/2501.01423","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:1da4d1edee023df2d85aa6a86d2fad8638d3fe27176ff8eaa9f326e66635af1e","observation_id":"4975f68d-d73b-4453-ba8e-dd1a490ff62e","resolution":{"observed_at":"2026-08-09T04:47:30.447243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-09T04:47:30.452091Z","title":"Y ., Zhang, H., Pang, R., Qin, J., Ku, A., Xu, Y ., Baldridge, J., and Wu, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.452091Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:2e0d4c0006796a04b3f419a4416ef99d492dc77b93e255509899058e583d1dc0","observation_id":"789bfca7-de10-42f5-9113-b2459896a84b","resolution":{"observed_at":"2026-08-09T04:47:30.452091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00776","last_updated":"2024-11-01T17:59:58Z","snapshot_observed_at":"2026-07-06T19:43:42.287026Z","submitted_at":"2024-11-01T17:59:58Z","title":"Randomized Autoregressive Visual Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00776","snapshot_observed_at":"2026-08-09T04:47:30.456843Z","title":"B., Versari, L., Sohn, K., Minnen, D., Cheng, Y ., Gupta, A., Gu, X., Haupt- mann, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.456843Z"},"links":{"cited_paper":"/paper/2411.00776","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:7f3cdaa392f0a927e8ddefdfe306fe63b5b7e9bd255b27335bab9d1a5319a1d0","observation_id":"4f9e08ab-7385-45d3-8d59-89606488a16e","resolution":{"observed_at":"2026-08-09T04:47:30.456843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.03924","last_updated":"2018-04-10T19:25:07Z","snapshot_observed_at":"2026-08-08T03:05:32.889595Z","submitted_at":"2018-01-11T18:54:17Z","title":"The Unreasonable Effectiveness of Deep Features as a Perceptual Metric","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.03924","snapshot_observed_at":"2026-08-09T04:47:30.461611Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.461611Z"},"links":{"cited_paper":"/paper/1801.03924","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:d423fa2535f5704586c305e688f649e879e24a37da741ddf75fa632c3e94a8e7","observation_id":"e9a29faf-4e30-48b8-973d-ebf8d3f21bbf","resolution":{"observed_at":"2026-08-09T04:47:30.461611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11837","last_updated":"2024-06-17T17:59:57Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:57Z","title":"Scaling the Codebook Size of VQGAN to 100,000 with a Utilization Rate of 99%","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11837","snapshot_observed_at":"2026-08-09T04:47:30.466469Z","title":"Scaling the codebook size of vqgan to 100,000 with a utilization rate of 99%","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.466469Z"},"links":{"cited_paper":"/paper/2406.11837","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:705d06cfdfec7ae630ca236c3f5b41329e899566948506128aa55903cb135f4f","observation_id":"6d3811b7-d03b-4fa6-9681-480d2b127e50","resolution":{"observed_at":"2026-08-09T04:47:30.466469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:47:31.330845Z","title":"We use a classifier-free guidance scale of 2.0","venue":null,"work_id":"503d3ac8-f81f-49ee-8f3d-a90fb730dccf","year":2022},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.475930Z"},"links":{"citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:5f1c8f3393d09dc38c57cd3124f7c1499c5c093a21b59ecc6fc786df1b77eaa2","observation_id":"6e725b27-a52b-4da1-883d-cbc5aafd01f2","resolution":{"observed_at":"2026-08-09T04:47:31.336142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:47:31.314936Z","title":"The maximum mean norm of the GMM in GMM 9 is bounded as: maxi ∥µi∥ ≤B","venue":null,"work_id":"281bd7f8-3404-44e2-b741-cc74d188a90c","year":2023},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.480997Z"},"links":{"citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:d905e212aafaf60ebcd42498c3c371a8c6708b4f6b7ab061e72b558c0d29fa8e","observation_id":"ea03c417-bd11-4343-8e02-e564b5aab4e5","resolution":{"observed_at":"2026-08-09T04:47:31.320117Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:47:31.299598Z","title":"In the practical sampling process, we adopt an early stopping strategy to improve the generation quality","venue":null,"work_id":"74b0b39b-81d6-412d-a9eb-376b6b406dce","year":2023},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.485553Z"},"links":{"citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:f92d43b5632a0144e9b3c2e5c887581aad8fa7248038e88d6039437eb9be4e5b","observation_id":"a53ad343-15a8-4942-b1db-7bb10809d55d","resolution":{"observed_at":"2026-08-09T04:47:31.304732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:47:31.284223Z","title":"Training Details of Diffusion Models We present the training details of SiT-XL and LightningDiT in Tables 8 and 9, which mainly follows their original setup","venue":null,"work_id":"9f5ed3a8-0366-42b8-8b42-33bb12b59263","year":2025},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.490415Z"},"links":{"citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:737ae36d526a6355ac1c7c10dcdf4338f127e594e921e4b1fa464fc5eff9cf19","observation_id":"5d3181e5-2e0c-4a4a-9cf4-19b46a46baba","resolution":{"observed_at":"2026-08-09T04:47:31.289147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:47:31.269038Z","title":"However, it is still extremely difficult to tune the guidance scale","venue":null,"work_id":"6d4ebea1-b171-41f4-814f-e85e03bec6b8","year":2024},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.494924Z"},"links":{"citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:11e3d5be0cc71efe5065cce362acefc18c3820a97ff307df5338165d7c6a2dd7","observation_id":"8e55d054-6c21-4d98-9a48-7c40f22e0da3","resolution":{"observed_at":"2026-08-09T04:47:31.273750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12095","last_updated":"2024-12-17T18:45:55Z","snapshot_observed_at":"2026-07-06T20:07:58.873037Z","submitted_at":"2024-12-16T18:59:29Z","title":"Causal Diffusion Transformers for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12095","snapshot_observed_at":"2026-08-09T04:47:30.310301Z","title":"Causal diffusion transformers for generative modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.310301Z"},"links":{"cited_paper":"/paper/2412.12095","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:1e1b08a87998bde120d083e744a944a9ddbabac950469c0ee017704b3fbc846f","observation_id":"a20dbb75-36c4-4e3b-9cae-5272442fb366","resolution":{"observed_at":"2026-08-09T04:47:30.310301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-09T04:47:30.338682Z","title":"and Salimans, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.338682Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:ccb8c5c8f8b14cec48b8095c4078b12426712a9d646bedf08a9b681b1e0f01fd","observation_id":"e36ec6ca-3dd3-4f37-a2c6-5abd453e03b0","resolution":{"observed_at":"2026-08-09T04:47:30.338682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16211","last_updated":"2024-12-08T19:55:36Z","snapshot_observed_at":"2026-08-04T16:36:02.143481Z","submitted_at":"2024-09-24T16:12:12Z","title":"MaskBit: Embedding-free Image Generation via Bit Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16211","snapshot_observed_at":"2026-08-09T04:47:30.438125Z","title":"Maskbit: Embedding-free image gen- eration via bit tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.438125Z"},"links":{"cited_paper":"/paper/2409.16211","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:f0277d5b2d9ed32eeb878ba5e4418c2fcea9845017ec9d7b4522c5ab04d61458","observation_id":"9a160977-3b0c-4400-874c-3912974a14f7","resolution":{"observed_at":"2026-08-09T04:47:30.438125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10511","last_updated":"2024-10-14T13:49:06Z","snapshot_observed_at":"2026-07-06T19:33:04.265295Z","submitted_at":"2024-10-14T13:49:06Z","title":"Customize Your Visual Autoregressive Recipe with Set Autoregressive Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10511","snapshot_observed_at":"2026-08-09T04:47:30.371836Z","title":"Customize your visual autoregressive recipe with set au- toregressive modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.371836Z"},"links":{"cited_paper":"/paper/2410.10511","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:aa5361db2cc5ad7549f5b1d5b218671efd2cfb03cfbd92f239a7f13579c39e52","observation_id":"51b913ed-3f84-47ad-ac19-9eda566c17f7","resolution":{"observed_at":"2026-08-09T04:47:30.371836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08740","last_updated":"2024-09-23T15:59:41Z","snapshot_observed_at":"2026-08-07T23:50:09.060564Z","submitted_at":"2024-01-16T18:55:25Z","title":"SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08740","snapshot_observed_at":"2026-08-09T04:47:30.381159Z","title":"S., Boffi, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.381159Z"},"links":{"cited_paper":"/paper/2401.08740","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:b90fd51ac6c4384bb73d9d62318730e5eac0341cbb43e9f8faa859097de7de7b","observation_id":"7a95c3cd-3a25-4e98-a7a1-e6a11eefd6d4","resolution":{"observed_at":"2026-08-09T04:47:30.381159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.07004","last_updated":"2018-11-26T13:54:12Z","snapshot_observed_at":"2026-07-06T05:19:33.033655Z","submitted_at":"2016-11-21T20:48:16Z","title":"Image-to-Image Translation with Conditional Adversarial Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.07004","snapshot_observed_at":"2026-08-09T04:47:30.342780Z","title":"Johnson, J., Alahi, A., and Fei-Fei, L","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.342780Z"},"links":{"cited_paper":"/paper/1611.07004","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:61f4f0ec621486b0ca56fed63efb93fef241dce3636ce08a37931632952c04ed","observation_id":"31e2148c-9c66-4b9c-a47c-a060c0486208","resolution":{"observed_at":"2026-08-09T04:47:30.342780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02507","last_updated":"2024-12-19T10:43:11Z","snapshot_observed_at":"2026-07-06T18:25:18.469656Z","submitted_at":"2024-06-04T17:25:59Z","title":"Guiding a Diffusion Model with a Bad Version of Itself","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02507","snapshot_observed_at":"2026-08-09T04:47:30.347845Z","title":"Guiding a diffusion model with a bad version of itself","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.347845Z"},"links":{"cited_paper":"/paper/2406.02507","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:6918898b182333fe18d6cdd2c3648a5794551a647423e1895844d27b83666929","observation_id":"5eaf9259-0ec0-4663-813e-57d3c40d5615","resolution":{"observed_at":"2026-08-09T04:47:30.347845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-09T04:47:30.320373Z","title":"Esser, P., Rombach, R., and Ommer, B","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.320373Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:1c55a166133650d7ec5e4816fc61dee0c5e1496ce94230a3a2f424ee716e117f","observation_id":"8cca33ac-068e-4140-9d17-48f02b7732b5","resolution":{"observed_at":"2026-08-09T04:47:30.320373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04200","last_updated":"2022-02-08T23:54:06Z","snapshot_observed_at":"2026-08-06T14:19:25.667074Z","submitted_at":"2022-02-08T23:54:06Z","title":"MaskGIT: Masked Generative Image Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.04200","snapshot_observed_at":"2026-08-09T04:47:30.283979Z","title":"Chen, H., Lee, H., and Lu, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.283979Z"},"links":{"cited_paper":"/paper/2202.04200","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:31793ae78d586cdaef30dec84df6569707d513e10967d33f88c94d75acf71654","observation_id":"83404af6-721b-4943-aeed-36ae6ac0d05f","resolution":{"observed_at":"2026-08-09T04:47:30.283979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-07-06T20:07:10.352535Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10958","snapshot_observed_at":"2026-08-09T04:47:30.290200Z","title":"Softvq- vae: Efficient 1-dimensional continuous tokenizer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.290200Z"},"links":{"cited_paper":"/paper/2412.10958","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:7579c964ae6afc6ece21106e4752827ebb74aa1e0bf467604a2ac04c9339d6f0","observation_id":"be54b425-21eb-4843-b885-592c25502b3c","resolution":{"observed_at":"2026-08-09T04:47:30.290200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:47:31.373892Z","title":"and Triggs, B","venue":null,"work_id":"cbb26ab4-012d-4b02-91e3-57ec38aa746c","year":2005},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.305669Z"},"links":{"citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:0cf988fef8a8b5de44e3c82cd2f2715a5fc1470db6bf0de723f816de9816ecb4","observation_id":"71d0b6c1-6bc6-4407-bb9f-b9a987532ae2","resolution":{"observed_at":"2026-08-09T04:47:31.378624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10733","last_updated":"2025-05-18T21:17:22Z","snapshot_observed_at":"2026-08-08T21:24:29.917572Z","submitted_at":"2024-10-14T17:15:07Z","title":"Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10733","snapshot_observed_at":"2026-08-09T04:47:30.295488Z","title":"Deep compression autoen- coder for efficient high-resolution diffusion models.arXiv preprint arXiv:2410.10733, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.295488Z"},"links":{"cited_paper":"/paper/2410.10733","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:5a8fff38b2153325fae6a7d3e1215d376e684c05a1dfc5907e18c1eb5bea770f","observation_id":"3cd3ba6e-4080-43b1-828f-b5e18f19838f","resolution":{"observed_at":"2026-08-09T04:47:30.295488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 9 inbound Pith citation observations for arXiv:2502.03444."}