{"as_of":"2026-08-14T16:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83bc735287ec98e8560e66c7f83900f2d56711bf9b52a35886449a8dbeb5a7c2","coverage":[{"denominator":126,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:33:13.575809Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T04:47:30.290200Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T18:13:49.029434Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10958","snapshot_observed_at":"2026-08-09T04:47:30.290200Z","title":"Softvq- vae: Efficient 1-dimensional continuous tokenizer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-14T06:34:40.934259Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.290200Z"},"links":{"cited_paper":"/paper/2412.10958","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:5038119e109d8d6877edcf884d28447ac7902ed0a93e7528a9199053c6636642","observation_id":"be54b425-21eb-4843-b885-592c25502b3c","resolution":{"observed_at":"2026-08-09T04:47:30.290200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10958","snapshot_observed_at":"2026-08-06T22:43:02.699039Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21022","last_updated":"2025-06-26T05:48:36Z","snapshot_observed_at":"2026-08-12T06:42:54.107173Z","submitted_at":"2025-06-26T05:48:36Z","title":"Instella-T2I: Pushing the Limits of 1D Discrete Latent Space Image Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T22:43:02.699039Z"},"links":{"cited_paper":"/paper/2412.10958","citing_paper":"/paper/2506.21022"},"observation_digest":"sha256:9989965051fbfe7ccfad8171603769242d9cfbd2f565d0d77b70aa2a7148e734","observation_id":"3913c8b6-1a18-49b6-8969-9b05bb6e4b43","resolution":{"observed_at":"2026-08-06T22:43:02.699039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10958","snapshot_observed_at":"2026-08-06T20:49:40.554531Z","title":"Softvq-vae: Efficient 1-dimensional con- tinuous tokenizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01756","last_updated":"2025-07-22T02:25:49Z","snapshot_observed_at":"2026-08-08T16:57:37.559490Z","submitted_at":"2025-07-02T14:33:52Z","title":"Rethinking Discrete Tokens: Treating Them as Conditions for Continuous Autoregressive Image Synthesis","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:49:40.554531Z"},"links":{"cited_paper":"/paper/2412.10958","citing_paper":"/paper/2507.01756"},"observation_digest":"sha256:f69171887ebc1d08e2b59d7f7cffef0aa985fab3f608e0617e22ddab5397451c","observation_id":"00cb8b07-238c-497a-97e4-1ca54dcd4c11","resolution":{"observed_at":"2026-08-06T20:49:40.554531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10958","snapshot_observed_at":"2026-08-06T19:41:23.624757Z","title":"Softvq-vae: Efficient 1-dimensional con- tinuous tokenizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04947","last_updated":"2025-07-07T12:45:23Z","snapshot_observed_at":"2026-08-10T07:36:03.612176Z","submitted_at":"2025-07-07T12:45:23Z","title":"DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:23.624757Z"},"links":{"cited_paper":"/paper/2412.10958","citing_paper":"/paper/2507.04947"},"observation_digest":"sha256:e106e35bc94089383c7993eb66a5bab57652a6ea3704352c09843a77d9ffde6b","observation_id":"62f40565-28e3-4d95-bbfe-fa5f79d53533","resolution":{"observed_at":"2026-08-06T19:41:23.624757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"cited_work":{"arxiv_id":"2412.10958","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10958","snapshot_observed_at":"2026-06-29T18:13:49.029434Z","title":"SoftVQ-V AE: Efficient 1-Dimensional Continuous Tokenizer","venue":null,"work_id":"eae7d78b-7222-4531-9b3b-dee0702c74b4","year":2025},"citing_paper":{"arxiv_id":"2605.27696","last_updated":"2026-05-28T13:12:21Z","snapshot_observed_at":"2026-08-13T03:43:24.580636Z","submitted_at":"2026-05-26T21:16:04Z","title":"Structure over Pixels: Learning Variable-Length Visual Programs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T18:06:01.684713Z"},"links":{"cited_paper":"/paper/2412.10958","citing_paper":"/paper/2605.27696"},"observation_digest":"sha256:52f81ea578500c27b469d33307f8584041b2e9220f90119a46d4ce37017f5dce","observation_id":"7508108d-4de6-4935-9311-117ed61ec7a3","resolution":{"observed_at":"2026-06-29T18:13:49.030820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.10958/citation-record","integrity":"/paper/2412.10958/integrity","json":"/paper/2412.10958/citation-record.json","paper":"/paper/2412.10958"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08797","last_updated":"2025-10-09T00:43:44Z","snapshot_observed_at":"2026-07-06T15:03:52.079498Z","submitted_at":"2023-03-15T17:43:42Z","title":"Stochastic Interpolants: A Unifying Framework for Flows and Diffusions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08797","snapshot_observed_at":"2026-08-11T15:33:13.009735Z","title":"Stochastic interpolants: A unifying framework for flows and diffusions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.009735Z"},"links":{"cited_paper":"/paper/2303.08797","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:ba912ae1777153a1c616dccf5b1e91a53948d5442a5eee691ffc1a94cddbca93","observation_id":"9900d614-266b-49b0-9c1a-3cf57d406d9f","resolution":{"observed_at":"2026-08-11T15:33:13.009735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.015948Z","title":"Reverse-time diffusion equation mod- els","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.015948Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:ccc9cd81be9159e3d441a7d121721e87f12c4f8b129ff22af0f6a80eca8564f4","observation_id":"24ae505f-851c-45c7-9555-3153ca79891f","resolution":{"observed_at":"2026-08-11T15:33:13.015948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.020950Z","title":"wav2vec 2.0: A framework for self- supervised learning of speech representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.020950Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:c0c2490e8229d4312093f4c94f253a06d12e7085e95ed304effbccabbe045a32","observation_id":"a47f9ab6-2a5e-4bdb-b659-f7f0be16135e","resolution":{"observed_at":"2026-08-11T15:33:13.020950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.025706Z","title":"All are worth words: A vit backbone for diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.025706Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:9d26d4f66a16797b4360efb44730fffef1b2d341d105da56b1238cfa0786d458","observation_id":"bb4694c3-b57d-45a2-8cbc-01694d3b2f55","resolution":{"observed_at":"2026-08-11T15:33:13.025706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-08-13T16:48:25.566954Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-11T15:33:13.030662Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.030662Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:4ff41c6aedc804203db16f7d0fc105ef1d6767c40cfd2695b856230c96d7e20d","observation_id":"0cff7665-d376-49fb-8422-aba97a363f2b","resolution":{"observed_at":"2026-08-11T15:33:13.030662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-13T04:36:44.594755Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-11T15:33:13.035747Z","title":"Lumiere: A space- time diffusion model for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.035747Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:fbd33affd0aeff28672c4081674740d6c8db9b9e5284fba9ceef5aa201a5f442","observation_id":"c0446b61-46d0-40fa-9ebb-20411102d66d","resolution":{"observed_at":"2026-08-11T15:33:13.035747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-08-14T04:51:04.817737Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-11T15:33:13.040831Z","title":"Estimating or propagating gradients through stochastic neurons for conditional computation","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.040831Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:30b789a1d71019c07182b4f9b2ff11f8b5374f5121b0a39af92185fd73c150a9","observation_id":"d239d2be-337d-4ce8-a5a8-d0b2430809bc","resolution":{"observed_at":"2026-08-11T15:33:13.040831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T15:33:13.045915Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.045915Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:4f165371851740154d9d9040b2e41343775f8ebcf091753012a5cee89fd4868c","observation_id":"8c011249-fe69-459b-b4eb-e5ff735012db","resolution":{"observed_at":"2026-08-11T15:33:13.045915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.051769Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.051769Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:2c3aaba499e43ebfc77ae2b6479e40fc230162b357974a0e63c6bbcf7399f1ba","observation_id":"b1d97961-7873-40de-85d4-674af203b838","resolution":{"observed_at":"2026-08-11T15:33:13.051769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.056446Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.056446Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:994887dd978e2948dbf26027efcd7f5b02e2a8e63ad5747e4c67874b300c38eb","observation_id":"ac6f7a15-4fcb-4bae-86a6-9641906ce980","resolution":{"observed_at":"2026-08-11T15:33:13.056446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10733","last_updated":"2025-05-18T21:17:22Z","snapshot_observed_at":"2026-08-13T23:46:55.707976Z","submitted_at":"2024-10-14T17:15:07Z","title":"Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10733","snapshot_observed_at":"2026-08-11T15:33:13.061018Z","title":"Deep compression autoencoder for efficient high-resolution diffu- sion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.061018Z"},"links":{"cited_paper":"/paper/2410.10733","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:8560ad967f939be2717fa7b142044cd6cb78f58a1aead293b7b13f804fda7d53","observation_id":"a6df8b20-ece5-45ee-a4cc-a076de1ae434","resolution":{"observed_at":"2026-08-11T15:33:13.061018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-14T09:58:22.897108Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-11T15:33:13.065992Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference ac- celeration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.065992Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:f327a95b870ba980b1a3a0f124f246affb8e46c4174fa6d7680f5bffe9621ada","observation_id":"2096eee0-1f88-45ef-b2c8-ede51a9c376a","resolution":{"observed_at":"2026-08-11T15:33:13.065992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02731","last_updated":"2017-03-04T06:19:22Z","snapshot_observed_at":"2026-08-10T07:26:39.808509Z","submitted_at":"2016-11-08T21:43:34Z","title":"Variational Lossy Autoencoder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.02731","snapshot_observed_at":"2026-08-11T15:33:13.070829Z","title":"Variational lossy autoencoder","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.070829Z"},"links":{"cited_paper":"/paper/1611.02731","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:50233b2e5af8b4350a5547f624248fafc259edb7d2d31c1ae7f2ae2aa2beafb7","observation_id":"f70478c1-0885-4542-a63c-8248a0b35cad","resolution":{"observed_at":"2026-08-11T15:33:13.070829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14404","last_updated":"2024-01-25T18:59:57Z","snapshot_observed_at":"2026-08-13T04:34:32.714579Z","submitted_at":"2024-01-25T18:59:57Z","title":"Deconstructing Denoising Diffusion Models for Self-Supervised Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14404","snapshot_observed_at":"2026-08-11T15:33:13.075744Z","title":"De- constructing denoising diffusion models for self-supervised learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.075744Z"},"links":{"cited_paper":"/paper/2401.14404","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:c32a3a84041190589766dc999431416173fbed3a35d0890b6ddb9b33da130a5b","observation_id":"c8ca871d-15cf-45a1-bae3-ea3b314ddf6c","resolution":{"observed_at":"2026-08-11T15:33:13.075744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.080828Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.080828Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:807f090856e21ec414987a4afdea46836f25137c94409623d3167ce12e7a7f35","observation_id":"743c731c-893c-4d8e-9825-f682a0a3ddb8","resolution":{"observed_at":"2026-08-11T15:33:13.080828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.085387Z","title":"Diffusion models beat gans on image synthesis, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.085387Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:74766b00ba6516826f5f4a3369feeb218494c4ae6246cdbfa8d71ebc13c061e8","observation_id":"1143e83c-f0eb-464d-b2c7-ae17989a1ed8","resolution":{"observed_at":"2026-08-11T15:33:13.085387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02648","last_updated":"2017-01-13T17:53:10Z","snapshot_observed_at":"2026-08-10T08:57:34.622770Z","submitted_at":"2016-11-08T18:36:36Z","title":"Deep Unsupervised Clustering with Gaussian Mixture Variational Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.02648","snapshot_observed_at":"2026-08-11T15:33:13.090116Z","title":"Deep unsupervised clustering with gaussian mixture variational autoencoders","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.090116Z"},"links":{"cited_paper":"/paper/1611.02648","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:46decdb1dc8bf8fb7491455f6cf60da2472e61694f12a8cfb050a546042b097d","observation_id":"0bf17e51-38f2-4f8d-bb23-d288308e3388","resolution":{"observed_at":"2026-08-11T15:33:13.090116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.094730Z","title":"Cogview: Mastering text-to-image generation via transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.094730Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:6aa3d907b50a04e9acefd3e153f8036c4af25631c1173485e1aadbeb2561064e","observation_id":"b88a35db-2660-4cc3-b414-b32fa1720ea5","resolution":{"observed_at":"2026-08-11T15:33:13.094730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.098832Z","title":"Peco: Perceptual codebook for bert pre-training of vision transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.098832Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:4e8e929178096365763a8fabeeb0349b569da164a942e7d1f937e221db547eb5","observation_id":"92711e0a-465b-4951-a83f-8c60e2581a62","resolution":{"observed_at":"2026-08-11T15:33:13.098832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.103290Z","title":"Generating images with perceptual similarity metrics based on deep networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.103290Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:cc52f6dc99c3e1e06aa787681b28b6837fa4ff98e22a630b73b678f0a6c01182","observation_id":"8b22cb5f-27c3-492a-b58a-29d27824802f","resolution":{"observed_at":"2026-08-11T15:33:13.103290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.107469Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.107469Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:552675c51b76efdb0608333e6dd0f267d13b6a0ff9ff2fce71c92c0656cb75e5","observation_id":"b382bc9e-5250-4a3f-b0bf-9cbff81601ac","resolution":{"observed_at":"2026-08-11T15:33:13.107469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.111511Z","title":"A fuzzy relative of the isodata process and its use in detecting compact well-separated clusters","venue":null,"work_id":null,"year":1973},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.111511Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:97a1a7ad87efe103cfd8e47caf210b86617a38079601b84b64d0f2308f5ccfdf","observation_id":"de3dd328-38f8-4409-b8c5-f3f22d24cf55","resolution":{"observed_at":"2026-08-11T15:33:13.111511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.115460Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.115460Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:892be51b8cba95d49589198111bf1d1479dbb79acdb684832eae16f5c2e6f12a","observation_id":"e4e92bd4-5d54-4b8a-b605-8333561202de","resolution":{"observed_at":"2026-08-11T15:33:13.115460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04825","last_updated":"2024-05-13T14:05:00Z","snapshot_observed_at":"2026-08-14T12:24:12.895232Z","submitted_at":"2024-02-07T13:23:25Z","title":"Fast Timing-Conditioned Latent Audio Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04825","snapshot_observed_at":"2026-08-11T15:33:13.119379Z","title":"Fast timing-conditioned latent audio diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.119379Z"},"links":{"cited_paper":"/paper/2402.04825","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:9b216b4286c00ea6cac44783a3289b12ef7710e03d15e7aa45d11af2ff1f6476","observation_id":"54ed0f68-2ac8-4c76-8713-e96c0ee2560c","resolution":{"observed_at":"2026-08-11T15:33:13.119379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13863","last_updated":"2024-10-17T17:59:59Z","snapshot_observed_at":"2026-08-13T23:30:37.164749Z","submitted_at":"2024-10-17T17:59:59Z","title":"Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13863","snapshot_observed_at":"2026-08-11T15:33:13.123915Z","title":"Fluid: Scaling autoregressive text-to-image generative models with continuous tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.123915Z"},"links":{"cited_paper":"/paper/2410.13863","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:56acdb6f06c4f0221a3940f42e7ea853b1d49203f8989e155647cdf3b106a469","observation_id":"ec433e16-34cc-484b-90c8-52b54acf0be1","resolution":{"observed_at":"2026-08-11T15:33:13.123915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.129163Z","title":"Eva-02: A visual representation for neon genesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.129163Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:5ad683802932e4629657eef76e5c3c7d3089604bc80a3bd7786485d804694c0c","observation_id":"1f1834e9-8542-4e38-a29d-e6bebdb4e362","resolution":{"observed_at":"2026-08-11T15:33:13.129163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06424","last_updated":"2025-03-16T03:30:10Z","snapshot_observed_at":"2026-08-12T22:27:45.067980Z","submitted_at":"2024-10-08T23:39:34Z","title":"Restructuring Vector Quantization with the Rotation Trick","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06424","snapshot_observed_at":"2026-08-11T15:33:13.133672Z","title":"Restructuring vector quantization with the rotation trick","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.133672Z"},"links":{"cited_paper":"/paper/2410.06424","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:27ae606a979bf0dcbf566b69eb917eea74e322d3b14bd2f602a704cc807ac2cd","observation_id":"9385977d-54a2-490e-88c2-97434ceac5b2","resolution":{"observed_at":"2026-08-11T15:33:13.133672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.138618Z","title":"Make-a-scene: Scene- based text-to-image generation with human priors","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.138618Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:76c163fee8bbcc5bc8535e0c5a1740aa910951cc2b1b4fe028540640c5dd4475","observation_id":"46df1f4d-cd50-47f2-b942-60f948d72f81","resolution":{"observed_at":"2026-08-11T15:33:13.138618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14389","last_updated":"2024-02-21T15:45:20Z","snapshot_observed_at":"2026-08-13T12:17:17.748027Z","submitted_at":"2023-03-25T07:47:21Z","title":"MDTv2: Masked Diffusion Transformer is a Strong Image Synthesizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14389","snapshot_observed_at":"2026-08-11T15:33:13.143121Z","title":"Mdtv2: Masked diffusion transformer is a strong image synthesizer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.143121Z"},"links":{"cited_paper":"/paper/2303.14389","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:0b304f120441efda435a8327ca839069622856899b19f6a85170d50d4d3bfdf8","observation_id":"3417631d-9c10-4451-96b7-39d53518d731","resolution":{"observed_at":"2026-08-11T15:33:13.143121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.148816Z","title":"Planting a seed of vision in large language model,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.148816Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:5b0cd1adae5c9921db56ac918cf4067c7091d5fa66e6d75605f19fc7a76f9e00","observation_id":"849e4bcd-c993-492a-a5f9-d12e86a61a47","resolution":{"observed_at":"2026-08-11T15:33:13.148816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-14T07:51:55.558110Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-08-11T15:33:13.153399Z","title":"Making llama see and draw with seed tokenizer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.153399Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:cd0d358f730e0f0ee026a34daec832d25b7572d99aebb61245a7def385a08605","observation_id":"93142e31-20c6-43bc-96bf-f63d2547d81f","resolution":{"observed_at":"2026-08-11T15:33:13.153399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08933","last_updated":"2023-02-14T06:45:49Z","snapshot_observed_at":"2026-07-06T14:06:34.310083Z","submitted_at":"2022-10-17T10:49:08Z","title":"DiffuSeq: Sequence to Sequence Text Generation with Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08933","snapshot_observed_at":"2026-08-11T15:33:13.158166Z","title":"Diffuseq: Sequence to sequence text generation with diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.158166Z"},"links":{"cited_paper":"/paper/2210.08933","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:d9f9ee70fe2dfefeda3fe0e41c743e6545e7012092d19fee20d6deaff96c173d","observation_id":"ec8f4e62-bd3b-44be-8aa1-8030aa58c767","resolution":{"observed_at":"2026-08-11T15:33:13.158166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.163379Z","title":"Generative adversarial networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.163379Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:31940f724e8396a97583f40c3636a110c4e618806d8d81483e0943548726c1af","observation_id":"cc01d630-7fee-40f5-afc0-eca3d3d9dca3","resolution":{"observed_at":"2026-08-11T15:33:13.163379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.167952Z","title":"Rethinking the objectives of vector-quantized tokenizers for image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.167952Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:b566015d5021871204ba98df78392ce2170e2766c84dbbafc6dea6b37015231e","observation_id":"fe3723f1-e282-4bf3-a68c-f17922b70194","resolution":{"observed_at":"2026-08-11T15:33:13.167952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.172497Z","title":"Masked autoencoders are scal- able vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.172497Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:760b8706066ac113bf7f1bd1f64b3997497ffdce4866dbf67a0eeac611e3d5be","observation_id":"a3a41adb-549a-4f40-a258-121a18145560","resolution":{"observed_at":"2026-08-11T15:33:13.172497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.176985Z","title":"Rotary position embedding for vision transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.176985Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:b5642f2a1b4000d2993b51e7582b853d5b30c775681a8b6d193699eec23daa18","observation_id":"bb2da402-168d-41b0-a4db-1cea0a84597f","resolution":{"observed_at":"2026-08-11T15:33:13.176985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.181358Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.181358Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:2f2c492c7cd736b4bd1915019eccd3328b60fcda1bc0cfee8f2988d6051e6df8","observation_id":"1c1aa017-323a-43c0-98be-f8fd56d0344c","resolution":{"observed_at":"2026-08-11T15:33:13.181358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.185786Z","title":"beta-vae: Learning basic visual concepts with a constrained variational framework","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.185786Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:56cf71d96970548955ce0d9a2db6f943cd62edbcb5265758e0415c7cbfcfa140","observation_id":"82f625b5-b7b2-4b8a-bb97-eb70ddaab0e9","resolution":{"observed_at":"2026-08-11T15:33:13.185786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.190239Z","title":"Reducing the dimensionality of data with neural networks","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.190239Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:092b032d84a99cda1052b350181aa11daebb14e61d2adfe1382ebd33b2a4ee10","observation_id":"8a34eb81-8c31-42f5-9946-c8f87659117b","resolution":{"observed_at":"2026-08-11T15:33:13.190239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-11T15:33:13.194625Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.194625Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:80074abd2d8ad7e74afa904bee7d268e972daa645ad64f31b78ceac1b904a1aa","observation_id":"c1f2f2ad-369f-4d26-a36d-f33821bf8966","resolution":{"observed_at":"2026-08-11T15:33:13.194625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.200079Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.200079Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:bc220c915d0627eee547490c2a97736aa4b027d2ac51c6f55098d655a70b43b1","observation_id":"dc383858-ad5f-462c-8882-33612857c5a6","resolution":{"observed_at":"2026-08-11T15:33:13.200079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.204507Z","title":"Video dif- fusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.204507Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:54035b63c50c1bc41cd24e0d7ddaa023939103bf60ab75bf36c1489b6f632fdc","observation_id":"4fd048ef-a21c-4a74-82cf-2fc837062b69","resolution":{"observed_at":"2026-08-11T15:33:13.204507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.209089Z","title":"Straightening out the straight-through estimator: Over- coming optimization challenges in vector quantized net- works","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.209089Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:2baf1fd8950c5c211216821676208edc72783f8a7bda988d73d404b9b09df3c1","observation_id":"ee5901eb-78f3-4d9c-916c-2b51e1aeb6b3","resolution":{"observed_at":"2026-08-11T15:33:13.209089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.213515Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.213515Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:3fdcdf0e153da44b5d632bfe215039d5fb196561a23bb7ff337d12cf153ccec6","observation_id":"bfa48579-4528-464c-a78b-19aeee4d71cc","resolution":{"observed_at":"2026-08-11T15:33:13.213515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.218002Z","title":"Product quantization for nearest neighbor search","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.218002Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:2713edbb6daf8a81da7cba8dd02608e942feb029261e97c53c4486222ef8c12f","observation_id":"b09be01b-fabb-4fe0-8c20-c94fb5ddfc55","resolution":{"observed_at":"2026-08-11T15:33:13.218002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.222387Z","title":"Percep- tual losses for real-time style transfer and super-resolution","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.222387Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:85fdce97643a90c2872258399972a914371021f8853a663b3cdfd54bc66ef77a","observation_id":"845aad99-60f4-4256-bd76-4797aa10a3ec","resolution":{"observed_at":"2026-08-11T15:33:13.222387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.226655Z","title":"Composing graphical models with neural networks for structured representations and fast inference","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.226655Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:c21a68534c1793007fc88a50e1ab08c341ac347182b2ad460063e81cb7ae407e","observation_id":"d97107ca-26cf-45b4-8372-3ed4378eb4fd","resolution":{"observed_at":"2026-08-11T15:33:13.226655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.231037Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.231037Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:c5042feac12a87fed4df8f305148a15a3ea431213277aaac8165ff665873f0f6","observation_id":"d2314b4e-09e8-4e8b-a0ce-a9819092303a","resolution":{"observed_at":"2026-08-11T15:33:13.231037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.235169Z","title":"Analyzing and improv- ing the image quality of stylegan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.235169Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:6069bf7751f4aa325634fc8ee7057e8ac12f190a296314b1459d60f9d484bcb7","observation_id":"3bb7f5d9-0e47-4e80-a3e3-c0a1f4c37cc4","resolution":{"observed_at":"2026-08-11T15:33:13.235169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.239231Z","title":"Understanding diffusion objectives as the elbo with simple data augmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.239231Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:15e08ecb1a916e70d1bed46844539ed7500e28756f6f57f6a4c6726fbb9f4eaa","observation_id":"507122e3-93e4-4b41-9699-0aa19b6c57d2","resolution":{"observed_at":"2026-08-11T15:33:13.239231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-11T15:33:13.243492Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.243492Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:3ef9c805a3b7c90171360ac8f752acc67e1b75539ffacfb1ccfd5207d22d3997","observation_id":"c85a29ca-c109-4c16-b6b1-ec339b0a5055","resolution":{"observed_at":"2026-08-11T15:33:13.243492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.247514Z","title":"Improved precision and recall metric for assessing generative models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.247514Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:623d8d422b4117d737ed2ef523edcc4f3f6b93c8aab7b2d82563f1056d20c7fc","observation_id":"141ab1c4-e1e4-4c9e-afee-a89683e0367c","resolution":{"observed_at":"2026-08-11T15:33:13.247514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07724","last_updated":"2024-11-06T14:29:36Z","snapshot_observed_at":"2026-08-13T00:32:43.044160Z","submitted_at":"2024-04-11T13:16:47Z","title":"Applying Guidance in a Limited Interval Improves Sample and Distribution Quality in Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07724","snapshot_observed_at":"2026-08-11T15:33:13.251602Z","title":"Applying guidance in a limited interval improves sample and distribution quality in diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.251602Z"},"links":{"cited_paper":"/paper/2404.07724","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:78d1af38dc0d0bf4e15365b7518faff67436590cd7653643d8a2fc926886af89","observation_id":"35e731ce-1456-454f-8a95-2f8a98d62b88","resolution":{"observed_at":"2026-08-11T15:33:13.251602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.256119Z","title":"Autoencoding beyond pixels using a learned similarity metric","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.256119Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:05ec3fece60326bb34a6e1b217726fb23129e8b866f734c2178fc54a787b692e","observation_id":"89b309de-3202-4693-897e-11534830e673","resolution":{"observed_at":"2026-08-11T15:33:13.256119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.260104Z","title":"Autoregressive image generation using residual quantization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.260104Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:0e921a49b356ad6d3db43e768e90d505cd9b263189954edfa5262193c9d52981","observation_id":"67582688-9b0c-44a4-96ea-43f913b4205b","resolution":{"observed_at":"2026-08-11T15:33:13.260104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.264143Z","title":"Autoregressive image generation using residual quantization, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.264143Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:26370857ee6c5a8dcb54946d9d2aac0d7479ab528c93033096b8bd41b64ee0c0","observation_id":"c5aa7035-2763-4a43-a457-12e32037db62","resolution":{"observed_at":"2026-08-11T15:33:13.264143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.268840Z","title":"Scalable autoregressive image generation with mamba","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.268840Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:2677d42d51bb92ded4e37cffc897aa05daddc1bdc86ad16a1d10f90e10fd3c43","observation_id":"57a51a0b-a6b9-4a9d-af6a-b9a6ccb24796","resolution":{"observed_at":"2026-08-11T15:33:13.268840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.273161Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.273161Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:23c80014410b97c59caed5016e6b52ab3a7756b6bd695185e76de713dae47f83","observation_id":"1169c724-5ac9-4147-9ce9-33e65e74ed67","resolution":{"observed_at":"2026-08-11T15:33:13.273161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.277694Z","title":"Mage: Masked generative encoder to unify representation learning and im- age synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.277694Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:efa47d1bf30e59229f371898499cb4f1a5221e4db32c1e165eb476ea12b61a5c","observation_id":"4c1cd7f6-e3f3-4deb-b36f-e5951e305a30","resolution":{"observed_at":"2026-08-11T15:33:13.277694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.282109Z","title":"Autoregressive image generation without vec- tor quantization, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.282109Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:055ceb639177f9cfd0cca8e43f7f423f19f517bfa0be5486f4908030d4a2e728","observation_id":"bf4f4048-1066-4e46-8d0e-4c2e74dc33c2","resolution":{"observed_at":"2026-08-11T15:33:13.282109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-08-12T23:30:17.473787Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-11T15:33:13.286584Z","title":"Tokenpacker: Effi- cient visual projector for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.286584Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:8cf31d0fd2151fe6363a171e9cc5bb23400255ab9c5f782afbe88031352fa86c","observation_id":"59e7046c-d4fb-4a3a-b6fb-0d8f77c9a4cd","resolution":{"observed_at":"2026-08-11T15:33:13.286584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01756","last_updated":"2024-12-03T20:32:52Z","snapshot_observed_at":"2026-08-14T12:27:18.151042Z","submitted_at":"2024-10-02T17:06:39Z","title":"ImageFolder: Autoregressive Image Generation with Folded Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01756","snapshot_observed_at":"2026-08-11T15:33:13.291256Z","title":"Imagefolder: Autoregres- sive image generation with folded tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.291256Z"},"links":{"cited_paper":"/paper/2410.01756","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:f34a5561e718921a47bda8baffef393a1f7fa55a96f9c02800ca45705cfac59c","observation_id":"499d77d8-1899-444e-8516-fa819ab0cbaa","resolution":{"observed_at":"2026-08-11T15:33:13.291256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-11T15:33:13.295905Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.295905Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:b63b43f9a289ff96798cf3f5e0ead0a11e57d791ee98cb21e77f672c5eb667fe","observation_id":"00011b92-6bd8-485b-96d9-c215a7ae257d","resolution":{"observed_at":"2026-08-11T15:33:13.295905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-08-13T14:59:44.917623Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-08-11T15:33:13.300508Z","title":"Sphinx: The joint mixing of weights, tasks, and visual embeddings for multi-modal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.300508Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:b40f7a74a7e0a784bf95006897c5df5561c704899aefa073de8a412f63d43506","observation_id":"44889bf7-01ad-45ee-b1e8-db53fd2be9c9","resolution":{"observed_at":"2026-08-11T15:33:13.300508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-11T15:33:13.306174Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.306174Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:19a332850b3d3e15024ce4e69582686ca0929e2aa43312e54c01fac0bfe09f8c","observation_id":"c931c434-6338-4352-860f-0570feba0c8e","resolution":{"observed_at":"2026-08-11T15:33:13.306174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10511","last_updated":"2024-10-14T13:49:06Z","snapshot_observed_at":"2026-08-13T20:54:52.263278Z","submitted_at":"2024-10-14T13:49:06Z","title":"Customize Your Visual Autoregressive Recipe with Set Autoregressive Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10511","snapshot_observed_at":"2026-08-11T15:33:13.310907Z","title":"Customize your visual autoregressive recipe with set autoregressive modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.310907Z"},"links":{"cited_paper":"/paper/2410.10511","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:f580e121f41cc9b16e133abf5224e953533984c62774ae6d391e61eb6fa84eac","observation_id":"9150376d-81ad-4bcb-b174-0056d66e846b","resolution":{"observed_at":"2026-08-11T15:33:13.310907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.315525Z","title":"Least squares quantization in pcm","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.315525Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:89fec1a456edc8936e647e6202c20871df1658eb56eca678fabd1c30f5d94551","observation_id":"726a3626-e1c0-4473-ab06-e2d8146533af","resolution":{"observed_at":"2026-08-11T15:33:13.315525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-11T15:33:13.319871Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.319871Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:5411359bb238eff87502e92b6d466e63a38b8ab24b05cf9e06755b973b0b2f1c","observation_id":"57702906-ab4c-431e-8e14-17d2c4ae0551","resolution":{"observed_at":"2026-08-11T15:33:13.319871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11081","last_updated":"2025-03-01T09:52:49Z","snapshot_observed_at":"2026-08-14T10:36:46.717239Z","submitted_at":"2024-10-14T20:43:25Z","title":"Simplifying, Stabilizing and Scaling Continuous-Time Consistency Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11081","snapshot_observed_at":"2026-08-11T15:33:13.324722Z","title":"Simplifying, stabilizing and scaling continuous-time consistency models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.324722Z"},"links":{"cited_paper":"/paper/2410.11081","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:d1c4bd31b218ca670dc3db248e3a74f7a190e93413a7bd1952051dcc4611e294","observation_id":"be5aefdb-81c7-48f6-b79b-131cbb6392c3","resolution":{"observed_at":"2026-08-11T15:33:13.324722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-13T04:03:01.615934Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-11T15:33:13.329381Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.329381Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:94986187a68a3d5b168d8a3c2b1e11884dafbe72c37e72503313903bbf0588a2","observation_id":"4f856e7e-0bec-498b-b64d-3a77b3e1661e","resolution":{"observed_at":"2026-08-11T15:33:13.329381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-14T02:43:25.975990Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-11T15:33:13.333762Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.333762Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:4f73da1426bfff3b88247d07df1aa1bd6020066bd82eaef6ec3c58a018ee3d83","observation_id":"1865715b-0ec9-436d-8a7a-29ba1fe52158","resolution":{"observed_at":"2026-08-11T15:33:13.333762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08740","last_updated":"2024-09-23T15:59:41Z","snapshot_observed_at":"2026-08-13T04:41:48.311151Z","submitted_at":"2024-01-16T18:55:25Z","title":"SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08740","snapshot_observed_at":"2026-08-11T15:33:13.338668Z","title":"Sit: Exploring flow and diffusion-based generative models with scalable interpolant transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.338668Z"},"links":{"cited_paper":"/paper/2401.08740","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:22ddd8427ffbcb4ed2c85270b1cb480d5cd0bdd9f647bb6cba61acc928537b75","observation_id":"ed533d42-d389-4536-944a-4e5090081365","resolution":{"observed_at":"2026-08-11T15:33:13.338668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.453492Z","title":"Finite scalar quantization: Vq-vae made simple, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.453492Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:33ee608ed41991ce5a2441e6936221919b13aca04512bc75943f149534fa6734","observation_id":"f497f54d-87d1-45a0-995b-47a998da0486","resolution":{"observed_at":"2026-08-11T15:33:13.453492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.458279Z","title":"Midjourney","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.458279Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:8f5c35e4a6b0640f7aee92048d4b7141f5f27923f1a750763cfd273dabdac7fd","observation_id":"9d681227-7bc2-4410-9fb1-bc818af2ff6e","resolution":{"observed_at":"2026-08-11T15:33:13.458279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.462613Z","title":"Improved denoising diffusion probabilistic models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.462613Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:411ca4e662821252384bd26d4e732ed16dd70d9ccd686902e85b81fcbfb5fb3f","observation_id":"ea32e042-1385-44a6-a156-62569add43f0","resolution":{"observed_at":"2026-08-11T15:33:13.462613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-11T15:33:13.467389Z","title":"Glide: Towards photorealistic image genera- tion and editing with text-guided diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.467389Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:152a24f1d0d346b390e7b308e6200a097681969ba05743d51f467b1008266306","observation_id":"0ecda30f-f230-4b73-beb4-abf7a71399ca","resolution":{"observed_at":"2026-08-11T15:33:13.467389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.472143Z","title":"Certain topics in telegraph transmission theory","venue":null,"work_id":null,"year":1928},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.472143Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:fb7f3b2cec92057c1b374b6f53266a7d2505b587cef76723f6dea51418010d72","observation_id":"ea5e38d4-aba4-47b9-a558-11df9c14e31c","resolution":{"observed_at":"2026-08-11T15:33:13.472143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.476838Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.476838Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:ce5003cde91f09e127be61a4e1b71438dedc4f30365564bb764ef9d5af840d87","observation_id":"cb9fa985-7de4-4a16-a860-bfbd59e658a5","resolution":{"observed_at":"2026-08-11T15:33:13.476838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:15.129981Z","title":null,"venue":null,"work_id":"294da282-25e2-4ba5-800c-e998875f8e84","year":2023},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.481171Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:dcb14c3b210c2282e703016243f416a81aad33ba326532aaa40511105b72604f","observation_id":"6eb381dc-708f-46c7-a2af-28e66d491ef1","resolution":{"observed_at":"2026-08-11T15:33:15.134776Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:15.113717Z","title":"Scalable diffusion models with transformers, 2023","venue":null,"work_id":"16632c5d-9173-4a01-83ed-44f6658d5503","year":2023},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.485672Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:520b0d8e0a5ff4c8820174ef83d49c22097a1a323cc79f560984a6d246edcb34","observation_id":"5c2bc65b-628b-4be3-9b02-f78e63f0a83e","resolution":{"observed_at":"2026-08-11T15:33:15.119464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:15.097950Z","title":"Grad-tts: A diffusion probabilistic model for text-to-speech","venue":null,"work_id":"fa3c8761-7cc5-4729-893f-05993ad8700b","year":null},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.490395Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:32ffbf26cc6c7e8d6e81e9052469d4f05a4702c11faa0467ad4ef5b3e0ac1d99","observation_id":"406bf857-fd21-48c1-8a34-16cfdd0b2451","resolution":{"observed_at":"2026-08-11T15:33:15.102846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:15.081863Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"8a6aa9af-eec6-4e1c-b7be-50ca1a2ded18","year":2021},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.494787Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:f3c5ef6598eab531d2d1d9a576d605b46420ae2a4b5806663d5dfc9df29534cc","observation_id":"9ca122af-6f1e-4e04-ba1a-e6ed126a86fc","resolution":{"observed_at":"2026-08-11T15:33:15.086872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:15.065490Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"0fd075de-b157-4781-9738-e8db0a6cdf6c","year":2021},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.499255Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:d0f4874966a1f260e2d97662cccc63808677e5cfce5703ea2db9f822ba74f0bb","observation_id":"14dcbe19-d435-4635-8304-b855b87e3322","resolution":{"observed_at":"2026-08-11T15:33:15.070087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:15.051132Z","title":"Gener- ating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":"ba7b6570-c591-4368-8f78-38dd81707081","year":2019},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.503593Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:c7feb7f7d18a8af4eec46e6046973584d34c073be35c9ec01c8e305e42ca319e","observation_id":"209686a3-ba66-49aa-8795-6f4dfe2535e3","resolution":{"observed_at":"2026-08-11T15:33:15.055563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:15.036705Z","title":"Gen- erating diverse high-fidelity images with vq-vae-2, 2019","venue":null,"work_id":"bba943b1-cb62-4102-8822-fcae35004624","year":2019},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.507957Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:5d8637ef3a1194d779a51a41ec1ab32b3dcc81707c5eb22d7f117ecef6afadf4","observation_id":"1b382d1e-4e6f-49c2-8076-cd5685bc64eb","resolution":{"observed_at":"2026-08-11T15:33:15.041377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:15.021926Z","title":"Gaussian mixture models","venue":null,"work_id":"3e0cef0c-1367-4a62-8fa2-c79d36530f15","year":2009},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.512417Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:20bdbbbed7063db20acd3b69ffbbee509a3a86dc400542cff80d2f8ef47e73c7","observation_id":"ad4194d3-5e82-4d50-b94e-c23654fba4d7","resolution":{"observed_at":"2026-08-11T15:33:15.026710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.516862Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.516862Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:3b2797086d017a36530bca423b4743b44a6c006e94f06e49eea23045d0882966","observation_id":"cdf455bc-8065-4e0f-84bf-a3e438ee94a1","resolution":{"observed_at":"2026-08-11T15:33:13.516862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:14.996776Z","title":"High-resolution image synthesis with latent diffusion models, 2022","venue":null,"work_id":"fd2929db-551f-4b3c-865a-77ae8732f5e0","year":2022},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.520973Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:bb3741493d6bb1f940094a5f5bf20ecebf3ced41d4a6e3fcbe9102a9331f2f78","observation_id":"1bb16e1f-b221-43e2-8d38-2e5acfa65ad5","resolution":{"observed_at":"2026-08-11T15:33:15.001592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:14.981768Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"ed2b6832-4c9a-4d66-9c31-9f9f942d82a6","year":2022},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.525631Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:151672571e6c17d0ef761172f6bab36d3e55b27eecef662532dbb0ecd0bb3270","observation_id":"8fd12bbb-487a-49cb-a534-dd23aa97b56e","resolution":{"observed_at":"2026-08-11T15:33:14.986771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:14.965593Z","title":"Improved techniques for training gans","venue":null,"work_id":"d7900d76-dcd1-4d23-977f-81904423f702","year":2016},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.530219Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:44869a363946faa4bd50a50736cbbc88eb2100b447b096bed8ef0d096708b95d","observation_id":"71269577-80cd-4ff2-8e74-cde7b10ceab7","resolution":{"observed_at":"2026-08-11T15:33:14.970885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:14.949369Z","title":"Communication in the presence of noise","venue":null,"work_id":"74c79403-3b33-4329-b820-1bc0a7d47e81","year":1949},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.534574Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:2c5fee7d26ba1851107a976b74a6bfbb42d6d86e8d05743561c9cbd41b0aaa3b","observation_id":"c0b1c941-672d-44d1-8dff-4a78af647f98","resolution":{"observed_at":"2026-08-11T15:33:14.954290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:14.934573Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"b4a4d102-3b93-43db-b73e-4c92716d2846","year":2015},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.539183Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:86bfbc4bfad6022d48a8d28cf8e1b362517e5c159f524bcbbf8ef9c5e7a6625b","observation_id":"2dd07c0d-d410-4cc2-b45c-97cb116b6729","resolution":{"observed_at":"2026-08-11T15:33:14.939417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:14.919463Z","title":"Weiss, Niru Mah- eswaranathan, and Surya Ganguli","venue":null,"work_id":"dff730de-1c7a-4125-abec-d9acb72dd0d8","year":2015},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.543486Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:29ffdc8a01516a0444627ab6175d82cc912b67a3f29726a854b3f98bd6af1115","observation_id":"cc611138-2587-411f-90ae-1614607b7534","resolution":{"observed_at":"2026-08-11T15:33:14.924652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10994","last_updated":"2024-12-17T02:05:27Z","snapshot_observed_at":"2026-08-14T05:35:56.747067Z","submitted_at":"2024-09-17T08:56:27Z","title":"Less is More: A Simple yet Effective Token Reduction Method for Efficient Multi-modal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10994","snapshot_observed_at":"2026-08-11T15:33:13.548179Z","title":"Less is more: A sim- ple yet effective token reduction method for efficient multi- modal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.548179Z"},"links":{"cited_paper":"/paper/2409.10994","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:48d8517644f63663cdf613b7749164dbed6b087037438719758a48ab1f3d1d60","observation_id":"acb165d3-b674-471a-90d0-a9a7c78b8304","resolution":{"observed_at":"2026-08-11T15:33:13.548179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:14.904419Z","title":"Denois- ing diffusion implicit models, 2022","venue":null,"work_id":"99f5576e-c3f2-42e2-ab28-0641e8d65c02","year":2022},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.553024Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:b69fb2711faea9a2146482829c99baa8001cc79d8b5302367ca64c0152df02c9","observation_id":"f35823c9-883e-47cd-88b6-c1529839663d","resolution":{"observed_at":"2026-08-11T15:33:14.909303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:14.889292Z","title":"Sd vae ft ema, 2023","venue":null,"work_id":"af286b10-1c38-442f-80be-0a58bce6f344","year":2023},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.557698Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:296bc445edabb45b032346143f1285ff17e7fec17ac554a9197883f22c53efe9","observation_id":"f8e0c1bc-1ad4-4908-9c88-155f982f70f9","resolution":{"observed_at":"2026-08-11T15:33:14.893960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:13.562297Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.562297Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:c8f836f7325d3569ef27d208830e18af8def5aef0149387d33b2597cfd207d99","observation_id":"758e142c-3232-4297-ba59-fd7f983a3cc6","resolution":{"observed_at":"2026-08-11T15:33:13.562297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-11T15:33:13.566667Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.566667Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:9d0ac7fab07190405778d2b47329072dd09259780bf20b53aaefe296b4b9f477","observation_id":"437128a1-8d6e-43fd-9d4c-098366ed7514","resolution":{"observed_at":"2026-08-11T15:33:13.566667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:14.864606Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction, 2024","venue":null,"work_id":"736fec5d-02fa-4fdf-9731-aec9d5dca264","year":2024},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.571484Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:facbd5ab3c005a48c7a2b24f820e1a0a96f35eec617f871125ece6b7309f01aa","observation_id":"ea6607b3-075d-441d-b325-9991145e8573","resolution":{"observed_at":"2026-08-11T15:33:14.869486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:33:14.849755Z","title":"Givt: Generative infinite-vocabulary transformers","venue":null,"work_id":"85bb4ce5-5c53-419b-99b9-09f0aa88941f","year":2025},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.575809Z"},"links":{"citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:40b009f2943dbf11fa09feed42ab9b445b2150ac38eb950ebe5832f02b6c1883","observation_id":"dfefb3a5-a806-49a5-82cd-c9263dd43973","resolution":{"observed_at":"2026-08-11T15:33:14.854543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T06:26:43.919459Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":83,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":126},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 100 of 126 outbound references and 5 inbound Pith citation observations for arXiv:2412.10958."}