{"as_of":"2026-08-17T21:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0aabba960777d3cd6a61a94d0a6181263253a018541e7fa3643ba84e201c2d19","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T22:56:36.235654Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:23:34.104214Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:28:29.656526Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18593","snapshot_observed_at":"2026-08-11T11:23:34.104214Z","title":"Diffusion autoen- coders are scalable image tokenizers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.15618","last_updated":"2025-03-24T23:10:37Z","snapshot_observed_at":"2026-08-13T07:49:34.539718Z","submitted_at":"2024-12-20T07:22:41Z","title":"3D Shape Tokenization via Latent Flow Matching","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T11:23:34.104214Z"},"links":{"cited_paper":"/paper/2501.18593","citing_paper":"/paper/2412.15618"},"observation_digest":"sha256:1e69f25b6707bfd7173e33b5d125e05d7db2a5b1b52726cc97ae6107131f6bd9","observation_id":"9e403f18-b92b-4636-9bc8-c38f38308274","resolution":{"observed_at":"2026-08-11T11:23:34.104214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18593","snapshot_observed_at":"2026-08-07T12:46:47.896319Z","title":"Diffusion autoen- coders are scalable image tokenizers.arXiv, abs/2501.18593, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23660","last_updated":"2025-05-29T17:09:25Z","snapshot_observed_at":"2026-08-12T19:13:20.732949Z","submitted_at":"2025-05-29T17:09:25Z","title":"D-AR: Diffusion via Autoregressive Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:47.896319Z"},"links":{"cited_paper":"/paper/2501.18593","citing_paper":"/paper/2505.23660"},"observation_digest":"sha256:57a69b1510ac0155814e4473870ada657e1a0ef02cc2296bae7c4ac44e3b4307","observation_id":"f9f6a167-692f-43c5-9e9b-258d056fdc24","resolution":{"observed_at":"2026-08-07T12:46:47.896319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18593","snapshot_observed_at":"2026-08-04T11:25:33.951411Z","title":"Diffusion autoencoders are scalable image tokenizers.arXiv preprint, 2501.18593, 2025d","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04961","last_updated":"2026-06-29T15:33:46Z","snapshot_observed_at":"2026-08-14T13:33:29.760598Z","submitted_at":"2025-10-06T15:57:31Z","title":"SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T11:25:33.951411Z"},"links":{"cited_paper":"/paper/2501.18593","citing_paper":"/paper/2510.04961"},"observation_digest":"sha256:b02ca6cc662a18155717668b045bf103e527749a12a58dd4d98a80ccc51c5cb8","observation_id":"918554f6-a36e-4b25-801b-a7567b8d98a5","resolution":{"observed_at":"2026-08-04T11:25:33.951411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"cited_work":{"arxiv_id":"2501.18593","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18593","snapshot_observed_at":"2026-07-03T14:28:29.656526Z","title":"arXiv preprint arXiv:2501.18593 , year=","venue":null,"work_id":"020ac850-eb3b-4d01-81b1-dbdbf4036d8f","year":null},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-12T18:02:55.540174Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2501.18593","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:13fbac402f52ae32c49588367c57859186ba692db9a8145bd134158df486095a","observation_id":"c5f8e4c3-3d5f-4a0d-a217-7affa712167b","resolution":{"observed_at":"2026-07-03T14:28:29.657972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.18593/citation-record","integrity":"/paper/2501.18593/integrity","json":"/paper/2501.18593/citation-record.json","paper":"/paper/2501.18593"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:35.990857Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:35.990857Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:3709b6736a89aac207f0cc4ceed4a1ef80a649ddbca8fc0cd07a4a5c31ed50a7","observation_id":"a314c0d1-094e-452f-8124-db83151f0e06","resolution":{"observed_at":"2026-08-09T22:56:35.990857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15571","last_updated":"2023-03-09T15:18:40Z","snapshot_observed_at":"2026-08-14T22:23:53.150627Z","submitted_at":"2022-09-30T16:30:31Z","title":"Building Normalizing Flows with Stochastic Interpolants","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15571","snapshot_observed_at":"2026-08-09T22:56:35.995742Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:35.995742Z"},"links":{"cited_paper":"/paper/2209.15571","citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:035755f605a4f8f8ec50642d072851cbf69e76f08a9a977fff64dc6b22f05001","observation_id":"a73694ac-a45d-4ed8-bad6-f1116f4b25c3","resolution":{"observed_at":"2026-08-09T22:56:35.995742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-09T22:56:36.000541Z","title":"L., Kiros, J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.000541Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:c21b6c34abde2d12668e27338625cab76846fbbc2fbdc83e1b5991dd61f90a47","observation_id":"51f69fb6-8201-49ca-b14c-d800777fd0f0","resolution":{"observed_at":"2026-08-09T22:56:36.000541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:37.238832Z","title":"BEiT : B ert pre-training of image transformers","venue":null,"work_id":"ceda04e4-a935-4043-80b9-69ab68e4b8a1","year":2022},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.004819Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:48045a0c879d8e9f5ded3fcaf35978c229e7a8d161e5accb58e66f05d6a8dc66","observation_id":"03e7c0c6-4f34-4b09-a876-78b1235abdeb","resolution":{"observed_at":"2026-08-09T22:56:37.243775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.008688Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.008688Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:741a04bfc0a7ca0716e5c3dbf8698c5e6e62d29635516da7a6f157997fcd95dd","observation_id":"bd473836-3366-4c46-8d6c-e79173e98b25","resolution":{"observed_at":"2026-08-09T22:56:36.008688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.012692Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.012692Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:582608fe20213952cda5aebfdbf92e06b2969fc985e381026bb9abd1e563febc","observation_id":"bd147583-64f2-48fd-a6b8-39dd7732d907","resolution":{"observed_at":"2026-08-09T22:56:36.012692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:37.218190Z","title":"W., Fidler, S., and Kreis, K","venue":null,"work_id":"d622f25d-fb68-4d18-a483-04ad79d2f622","year":2023},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.016572Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:35dcbd0265312e1a8f839623b77eb930596f85b25ccda64f470f60f06c006594","observation_id":"c1d34611-a480-4551-93b1-1c27609859e9","resolution":{"observed_at":"2026-08-09T22:56:37.222936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:37.204731Z","title":"Pros and cons of gan evaluation measures","venue":null,"work_id":"e6a3fb49-237e-4d37-b871-c464298d618b","year":2019},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.020768Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:7b8f030b08297d1a5d5650620d98f366403486cad1f38f1254ac4f8a07f81a06","observation_id":"69b81172-35c2-46c2-8467-ea960fdc8e06","resolution":{"observed_at":"2026-08-09T22:56:37.209506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:37.190983Z","title":"Pros and cons of gan evaluation measures: New developments","venue":null,"work_id":"55d7eafb-6b2a-4053-a141-e0d5ea811e1a","year":2022},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.024342Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:6f93cc619e0101269aef401800590b288c0bc8141ae358198c8cada259be2c08","observation_id":"73b084b9-e534-4c81-b9cc-2d5678e7cc4a","resolution":{"observed_at":"2026-08-09T22:56:37.195969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:37.177408Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":"4e16bfca-51f9-4e46-9824-db521a62d383","year":2021},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.028222Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:bb608eebce88ff2c2df3ed267c6bff469f28fff2914b5637f67d7ad6ee1e2d12","observation_id":"71b65e7b-ca2c-4f69-8a54-7bf4a4ea6b4b","resolution":{"observed_at":"2026-08-09T22:56:37.182061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:37.164871Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"9caa1116-7889-4980-9afe-69d9d3020934","year":2020},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.032253Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:8f1bbdfa3ccbb62c4e6ab33af4b56f74ec5d4077f0e98133b96e499ba18fc9d2","observation_id":"341bcac7-b61d-4fea-ad9d-d282be6da10f","resolution":{"observed_at":"2026-08-09T22:56:37.169439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:37.152804Z","title":"Image neural field diffusion models","venue":null,"work_id":"318235f3-6a67-48b1-8e2c-476bf41b870e","year":2024},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.035922Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:1e83a758b939e2a26583af9f240f694cf2c8095839cd3c44a4e9f578483695ed","observation_id":"70758ad5-69f3-401b-be15-d993f4ab1a4e","resolution":{"observed_at":"2026-08-09T22:56:37.157002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15807","last_updated":"2023-09-27T17:30:19Z","snapshot_observed_at":"2026-08-16T14:57:07.361681Z","submitted_at":"2023-09-27T17:30:19Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15807","snapshot_observed_at":"2026-08-09T22:56:36.039705Z","title":"Emu: Enhancing image generation models using photogenic needles in a haystack","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.039705Z"},"links":{"cited_paper":"/paper/2309.15807","citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:09b4dea564829984b4c4d6a9af66ca3661b511ea496a2090fa40bf7f4899cb24","observation_id":"93ebca15-40e5-4583-960e-0959d235062c","resolution":{"observed_at":"2026-08-09T22:56:36.039705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.043727Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.043727Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:ea66a3abcf4f7a8d4f628faf6673099dd9d3b36be8244a79aeadaa164e51b188","observation_id":"26aabed6-ca60-4b88-86fa-93cfb366d1c6","resolution":{"observed_at":"2026-08-09T22:56:36.043727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.047299Z","title":"and Nichol, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.047299Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:f0d8259151ee0998f5265beb9d33cc4d0ca934e4f8f1c0f1114aa89576e07fee","observation_id":"91ac52c1-a11e-4e61-ac08-c63e585700a7","resolution":{"observed_at":"2026-08-09T22:56:36.047299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:37.126440Z","title":"Adversarial feature learning","venue":null,"work_id":"f95bd85a-65ef-499e-8b5e-eb388c43d1da","year":2016},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.052169Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:7d5f7dfa32b98783d65fa89ce48ad1f292960a7b3b931f5b71e5355e90b96fc8","observation_id":"f128788f-40b9-4c8d-a4a5-d29e1ab2d499","resolution":{"observed_at":"2026-08-09T22:56:37.130822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.055986Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.055986Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:3222c13bff1e3bf9a1a60c1d0cd955a66222c372c34dce56d6709da9090c875b","observation_id":"370e115a-019e-4d3f-8fc3-e45ee9ebc0f4","resolution":{"observed_at":"2026-08-09T22:56:36.055986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-16T14:42:19.011451Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-09T22:56:36.059679Z","title":"S., Shah, A., Yin, X., Parikh, D., and Misra, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.059679Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:5b221ac034488100464ad77851886e8e6b455b2a58017e10271baf6c8ba9ef26","observation_id":"1c0bdc77-daf9-4d5d-a6c7-979593719cff","resolution":{"observed_at":"2026-08-09T22:56:36.059679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.067740Z","title":"Generative adversarial networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.067740Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:1cf406e8da69714877d3b40d95c8bcca165787c7a56e7ae2e27d80de9b3fa554","observation_id":"60393605-e100-44fd-82fc-88ef34a2d397","resolution":{"observed_at":"2026-08-09T22:56:36.067740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.070814Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.070814Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:598e10e9e1d27fbca163fecf13bfbbfb476ef590eccefc7e59231dc8156584cd","observation_id":"57a91fb8-b825-45af-979c-7a08be27d20b","resolution":{"observed_at":"2026-08-09T22:56:36.070814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.073560Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.073560Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:3cd8f9bb7d4ff2532d5b73dd5aa961431ac75646c0bf71f66428dd14d65d5d9f","observation_id":"6b6c396b-90e0-4839-ad37-5e9f083842f5","resolution":{"observed_at":"2026-08-09T22:56:36.073560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.076431Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.076431Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:9b64577174f41075b1f204c7bc7e47db3dc486c2cab692f9df5ad73886df1265","observation_id":"5cadd866-2cfd-4cc9-8a48-669e560d9eba","resolution":{"observed_at":"2026-08-09T22:56:36.076431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.079211Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.079211Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:c512433ce9403120571bd4d9ba34f0d4a003f88af1b012e16c6e4ae0dae1104b","observation_id":"cfb26366-2b0d-4e56-aeeb-78e701513d0a","resolution":{"observed_at":"2026-08-09T22:56:36.079211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.081999Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.081999Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:3a5f9fe1a25c009a8af533563648081fc0df137ba25d072ce66a06ab558ddb57","observation_id":"7f379b02-b4c0-42a2-9f67-3799725df880","resolution":{"observed_at":"2026-08-09T22:56:36.081999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:37.064862Z","title":"Rethinking fid: Towards a better evaluation metric for image generation","venue":null,"work_id":"d4987ec5-65be-44c4-bac8-3f167759ce9e","year":2024},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.084847Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:b8154481486555e61e7eb203ed6867428bca58fc596124318e9037f92eb92425","observation_id":"fcabb41b-00ba-4d56-979b-0f2336277437","resolution":{"observed_at":"2026-08-09T22:56:37.069546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.087805Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.087805Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:9d891c398c00e72ec5b160597b53c06f60aa5b3556bc6983b3a0f616f353748d","observation_id":"98eb0240-34ff-428d-b74a-af0e0e576fba","resolution":{"observed_at":"2026-08-09T22:56:36.087805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.090982Z","title":"Analyzing and improving the training dynamics of diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.090982Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:2780999283195285ef04b5a636ae195a4656d930e56051088dafe5efa371cdad","observation_id":"9a828c66-830d-438f-9587-2eb859bf1bca","resolution":{"observed_at":"2026-08-09T22:56:36.090982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:37.038044Z","title":"and Gao, R","venue":null,"work_id":"e8d76464-6b80-4e16-bdd4-a93c9d772890","year":2024},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.093981Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:067c5783d9d18b91a530436e32e1bcb64413f1dc5af30904d99ae5625db7f542","observation_id":"b0d71f46-18ed-42dd-90a2-8424da663027","resolution":{"observed_at":"2026-08-09T22:56:37.042489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.097117Z","title":"Photo-realistic single image super-resolution using a generative adversarial network","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.097117Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:1d56c98b0c90169292255be82b6518c77f964fbd05ea0bb399796c7ca645e28f","observation_id":"304f53c2-6517-486d-a8bc-e604d777c048","resolution":{"observed_at":"2026-08-09T22:56:36.097117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-08-16T13:42:07.461220Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-09T22:56:36.099974Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.099974Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:96c427d26be51723f1d70107ef9e47db25bb96654099121b95e484b91d1a6aed","observation_id":"d9a31b7c-f6bf-419a-a06b-de303ddf1f8d","resolution":{"observed_at":"2026-08-09T22:56:36.099974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.103548Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.103548Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:e1e0c9008cde6ab943692dd0a23d79604234160640efc0a58849a4b32a68f455","observation_id":"f1050be2-8d99-49d2-bc2a-35b310345743","resolution":{"observed_at":"2026-08-09T22:56:36.103548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-09T22:56:36.107175Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.107175Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:2f6294af02ee6fc999e1294fffa2b0f7450319eafa703154129136f68bbb03ad","observation_id":"ef854193-a3a1-4fed-8259-0025f5615595","resolution":{"observed_at":"2026-08-09T22:56:36.107175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.111207Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.111207Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:fecb124e46f75c3d4bbfc9266893ea4a5500b4d1b54d412aa25241096f5464bf","observation_id":"6461efa8-c9bf-48df-9ef6-f42066f6c759","resolution":{"observed_at":"2026-08-09T22:56:36.111207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11081","last_updated":"2025-03-01T09:52:49Z","snapshot_observed_at":"2026-08-14T10:36:46.717239Z","submitted_at":"2024-10-14T20:43:25Z","title":"Simplifying, Stabilizing and Scaling Continuous-Time Consistency Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11081","snapshot_observed_at":"2026-08-09T22:56:36.114879Z","title":"and Song, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.114879Z"},"links":{"cited_paper":"/paper/2410.11081","citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:9f8e240c2a03ff1643cf8b63535268fceef09458928ddcda7b98ff6c81dcbb39","observation_id":"a102542e-55fa-47a3-9481-0b6ca13e6ebd","resolution":{"observed_at":"2026-08-09T22:56:36.114879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:37.004554Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps","venue":null,"work_id":"11ce14e9-6376-449d-817e-d18db90a2f7f","year":2022},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.119147Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:5398b08d814118414ed936db84147abcfa7d9ab00f26e38798e9c887b14b18d4","observation_id":"16cb503b-4aad-468c-9ca2-86fd03a50c95","resolution":{"observed_at":"2026-08-09T22:56:37.009144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.992178Z","title":"Stacked convolutional auto-encoders for hierarchical feature extraction","venue":null,"work_id":"ff04ce90-d4b7-4114-ba39-d39694eb6117","year":2011},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.122599Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:68b92be9d02281c3833d7ff7c36c42b9310dab574802d80e703516c3a8605296","observation_id":"73695c68-9d10-48e0-8160-b9a0a4058547","resolution":{"observed_at":"2026-08-09T22:56:36.995767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.981787Z","title":"and Maaten, L","venue":null,"work_id":"e004dd63-3e36-4a45-b8af-a7972a2a737f","year":2020},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.126015Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:2207b43ddc83e43d69d9727dc013b32e298b90f29ae02f9bf3df44664dc3ecbc","observation_id":"9a37c3f8-4cc3-49d1-80e6-c1b03008a249","resolution":{"observed_at":"2026-08-09T22:56:36.985274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-09T22:56:36.129503Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.129503Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:614cd27197b6a4b2c2934f424f1c245f36535557eb5d2db4806bad606aad9a80","observation_id":"d048911a-7e17-488e-8485-5437b8136f3f","resolution":{"observed_at":"2026-08-09T22:56:36.129503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.133073Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.133073Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:9e0e78611c7def98d81d2e4063467ba82fbc9f040380cb94a3e6b1c8685b833e","observation_id":"e652869b-bef4-4cb8-b174-44e467f135e4","resolution":{"observed_at":"2026-08-09T22:56:36.133073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.966192Z","title":null,"venue":null,"work_id":"245a42b9-fa3b-461c-aa5e-b38d451372bd","year":2018},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.136688Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:df3700f8362515f7782c107d9c435c4e5809e4b2392d77b2efc766ba030f8828","observation_id":"48080c0d-e3c6-45e9-ba29-845bb9f41239","resolution":{"observed_at":"2026-08-09T22:56:36.969262Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.957080Z","title":"Diffuse VAE : Efficient, controllable and high-fidelity generation from low-dimensional latents","venue":null,"work_id":"270bd95b-a98a-4a18-8f72-b4901a4cf104","year":2022},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.140145Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:a1e480fa079d40b4f23d1058032d688d60f6998f4cbdb7d033512e6d6b415595","observation_id":"4e1f994f-b339-4930-924b-b4db5644dbc8","resolution":{"observed_at":"2026-08-09T22:56:36.960143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.143524Z","title":"and Xie, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.143524Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:a71cf5acce0132a111cbd38dbaf0dadd07a3a97123611695e8fee1b4686f0c93","observation_id":"f67e4eaf-2966-4250-9a3e-ad7666a9bf9e","resolution":{"observed_at":"2026-08-09T22:56:36.143524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.939726Z","title":"L., Pal, C., and Aubreville, M","venue":null,"work_id":"a7ead8a0-9203-4575-8c0d-754da391e5e7","year":2024},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.147089Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:b26124c66c7c6d060a2bd01743334a0021a4e4613be07f1319007771ad93e95f","observation_id":"01ea68a9-d96b-4a43-aa33-29c305f2a344","resolution":{"observed_at":"2026-08-09T22:56:36.943136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.928697Z","title":"SDXL : Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"007ce558-af9f-4925-bd05-7a9c8a3d623a","year":2024},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.150542Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:621383ffbe9be17070788a9d8a0b77919d105b0ae63658917f2fea406ce84487","observation_id":"22a7776a-4cb5-4829-b6b8-b7d8a1dc7469","resolution":{"observed_at":"2026-08-09T22:56:36.932344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-17T10:09:03.767186Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-09T22:56:36.153918Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.153918Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:26477661602a15213666f9568ee155751ff6d8a80e4fe279564cb54478d91f1f","observation_id":"6de2d389-5659-4dca-a761-eb794a9eaf20","resolution":{"observed_at":"2026-08-09T22:56:36.153918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.917791Z","title":"Diffusion autoencoders: Toward a meaningful and decodable representation","venue":null,"work_id":"104bb015-c974-4029-9ec8-6614a1c2adee","year":2022},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.157536Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:f02e7144dce697ba77446353c21408431737cc675db41e9a9e2c1ec9afb4fbe2","observation_id":"07b008da-c91a-4448-8b6b-3e6218b4167c","resolution":{"observed_at":"2026-08-09T22:56:36.921496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-09T22:56:36.160839Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.160839Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:a72eefaf4ce8a304b3656c0c7148c7bcb19cc6ce382644c64e4e3f41dda54af1","observation_id":"b05b5223-7f12-49c5-84ad-27617c94a8f1","resolution":{"observed_at":"2026-08-09T22:56:36.160839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.907008Z","title":"Unsupervised learning of invariant feature hierarchies with applications to object recognition","venue":null,"work_id":"10264204-ee2b-4bd9-af5c-7347c25c55a4","year":2007},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.164618Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:0cce10bc32f136664128c836ceb199bfae049a09e30540177e5fb54c4491b0c8","observation_id":"20f4cfb5-a412-424c-9e63-62b0f013235a","resolution":{"observed_at":"2026-08-09T22:56:36.910815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.167843Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.167843Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:a543bcf5b4363b93c24126915b82b2a375b55b02b52f6670fe7ba9c6bef7b392","observation_id":"a740689e-1f1e-41e6-8a36-95e44c12ed49","resolution":{"observed_at":"2026-08-09T22:56:36.167843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.889787Z","title":"and Hinton, G","venue":null,"work_id":"5244c66c-eb72-40a2-9648-7cc64579d1cb","year":2009},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.171377Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:11f6886e627eb7a1952f5335e3acfe70474a13b4ea4bbf9e20b7a67ce0301981","observation_id":"719b373a-823d-4514-8e5a-a803edc8a5cb","resolution":{"observed_at":"2026-08-09T22:56:36.893188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.175161Z","title":"and Ho, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.175161Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:b1138f3fd0ec10669cec92a61db04baddb9abb59ebaa4cdc3302e7a6944b7305","observation_id":"682fd855-219c-498d-b67f-777046f225c6","resolution":{"observed_at":"2026-08-09T22:56:36.175161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04103","last_updated":"2024-06-06T14:20:21Z","snapshot_observed_at":"2026-08-16T13:45:31.181384Z","submitted_at":"2024-06-06T14:20:21Z","title":"Multistep Distillation of Diffusion Models via Moment Matching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04103","snapshot_observed_at":"2026-08-09T22:56:36.178917Z","title":"Multistep distillation of diffusion models via moment matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.178917Z"},"links":{"cited_paper":"/paper/2406.04103","citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:c8ce410dfeb4f6b2c61aeca983a3310c6603f7e66ea9d92eedf99eeeac3182a7","observation_id":"d17e275d-414a-48c3-97bd-b2ebd8a4ced0","resolution":{"observed_at":"2026-08-09T22:56:36.178917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.182837Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.182837Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:3a0db71ac304f83a5483e1cfd89b0bb381311b43ef86bc6953364e4bd6e789de","observation_id":"6e733bc6-6411-4ddd-823b-015b650d5299","resolution":{"observed_at":"2026-08-09T22:56:36.182837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.186281Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.186281Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:18d341b189240fa3055dfc08baa9bf1c99c2b2002838e459192cf0be47cfc1d4","observation_id":"a454d409-f1af-4def-82e2-4a1759443042","resolution":{"observed_at":"2026-08-09T22:56:36.186281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.189850Z","title":"and Dhariwal, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.189850Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:29e2a597f4de1b9ef67e98c78177c66bdc3ca614001dcccd7e7bbb0ebee4426f","observation_id":"f191d790-fa97-4061-91dc-5000501e89cb","resolution":{"observed_at":"2026-08-09T22:56:36.189850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.193379Z","title":"and Ermon, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.193379Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:218bab36aa2020a6fed50c236dbd289c5c1d03c956a15b807a4f1bd529281648","observation_id":"8b9a4516-8227-4d60-be4c-2258d330effb","resolution":{"observed_at":"2026-08-09T22:56:36.193379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-09T22:56:36.196527Z","title":"P., Kumar, A., Ermon, S., and Poole, B","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.196527Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:3f17b590e4b0fe95b54adbecf6524ba7a2eeec1d8a0acf33ffa5d516f40c6bb5","observation_id":"35cb72f2-e4c3-4cae-80f6-fe051d68bf32","resolution":{"observed_at":"2026-08-09T22:56:36.196527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.199954Z","title":"P., Kumar, A., Ermon, S., and Poole, B","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.199954Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:08f65af44c51ab70650bafaa3a18fc218608ded0247061bdba9d4ed60f607458","observation_id":"772d77e5-f8f6-47dc-a53b-b30d76865cd3","resolution":{"observed_at":"2026-08-09T22:56:36.199954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.841314Z","title":"Consistency models","venue":null,"work_id":"85294de3-6474-4412-a01b-c4996a50cf81","year":2023},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.203349Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:0a3bb262e6cb9fcd5974fa291f9d2dbdea6a5b848fe5bef0226b1b53da76add0","observation_id":"f0b51721-9f23-4365-85cc-bfec5f634cf9","resolution":{"observed_at":"2026-08-09T22:56:36.845076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.830103Z","title":"Extracting and composing robust features with denoising autoencoders","venue":null,"work_id":"bfaa626c-86b0-47ba-aeb4-954b760322c9","year":2008},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.206301Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:d467ce2cddffb145b560e29315854c058f81538aab3538b7810b2761f84cc096","observation_id":"080034e6-9ff0-4c58-82d0-fb680c7da5c5","resolution":{"observed_at":"2026-08-09T22:56:36.834209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.818862Z","title":"Esrgan: Enhanced super-resolution generative adversarial networks","venue":null,"work_id":"d101068d-a5ec-45c5-8ecf-5e99fabbe717","year":2018},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.209560Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:a679c1548d9dfceebb7fe1e12b521bd5c346316fd801c4de9dbfbfd0fa93773c","observation_id":"a59741cb-79c8-4d60-8576-d39b38605987","resolution":{"observed_at":"2026-08-09T22:56:36.822597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.806290Z","title":"Real-esrgan: Training real-world blind super-resolution with pure synthetic data","venue":null,"work_id":"0227742f-ec2e-4f04-9f0d-b28266ef2662","year":1905},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.212596Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:fe173a8f82ed6fad539c36d4ca7eb87c6d13475bb7a0abe54dd1d339f6cec67d","observation_id":"71413202-b732-49af-a07b-48d05e6acda8","resolution":{"observed_at":"2026-08-09T22:56:36.811042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16852","last_updated":"2024-12-06T06:07:45Z","snapshot_observed_at":"2026-08-16T19:42:08.992890Z","submitted_at":"2024-05-27T05:55:22Z","title":"EM Distillation for One-step Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16852","snapshot_observed_at":"2026-08-09T22:56:36.215703Z","title":"P., Hou, T., Wu, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.215703Z"},"links":{"cited_paper":"/paper/2405.16852","citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:03af63ae096d075ef7091461e3f92e6da91696a3ad7d305f243e1d757c02258d","observation_id":"8406581b-ae79-434d-b038-dfb13a2462cb","resolution":{"observed_at":"2026-08-09T22:56:36.215703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.793599Z","title":null,"venue":null,"work_id":"b2bd5f91-4316-4675-8bdb-eeb7d5f36a2a","year":2024},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.219458Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:2485bd97e5cad79befa73250448329b544de958772a0cb5180bb59db77d1b1fb","observation_id":"3df9f2e7-9741-4d87-afe8-6caf18fa55ce","resolution":{"observed_at":"2026-08-09T22:56:36.798382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.223355Z","title":"T., and Park, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.223355Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:9e314b5fb9d13e47fb0d885a44ef4d0738bae61d6a182881e5b63c4104ff7bd0","observation_id":"f9f62721-9cf8-435d-9acb-a2b43d6cad23","resolution":{"observed_at":"2026-08-09T22:56:36.223355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-08-14T02:29:38.306439Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-09T22:56:36.227366Z","title":"Y., Luong, T., Baid, G., Wang, Z., Vasudevan, V., Ku, A., Yang, Y., Ayan, B","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.227366Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:e8089afc4b19f98020df07004e9360ef4ee10de4fb3b8b5fcbcad66e01343f82","observation_id":"10880191-3d47-4747-ab61-163f8a62be6b","resolution":{"observed_at":"2026-08-09T22:56:36.227366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:56:36.231817Z","title":"A., Shechtman, E., and Wang, O","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.231817Z"},"links":{"citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:05f3611bf6c72ce51a5292bf2ac8111cd5b24ef6ac05b80739edebf8b5e38334","observation_id":"b4550f88-6475-465b-8a39-891b8ad6e24f","resolution":{"observed_at":"2026-08-09T22:56:36.231817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04081","last_updated":"2025-05-28T19:15:39Z","snapshot_observed_at":"2026-08-16T13:12:21.832428Z","submitted_at":"2024-10-05T08:27:53Z","title":"Epsilon-VAE: Denoising as Visual Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04081","snapshot_observed_at":"2026-08-09T22:56:36.235654Z","title":"-vae: Denoising as visual decoding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.235654Z"},"links":{"cited_paper":"/paper/2410.04081","citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:2467234fe45750df5e290c1bd0ed2d905c5399f3e1cdb8ebc440dfcf039afa94","observation_id":"6ece528b-28f1-436c-be1c-fbf0048ec9ce","resolution":{"observed_at":"2026-08-09T22:56:36.235654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T03:36:54.371834Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 4 inbound Pith citation observations for arXiv:2501.18593."}