{"as_of":"2026-08-09T04:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f134263fb5614e6abf14c72c7af9b98ed3b9efcb616364808c5a431bf42ce481","coverage":[{"denominator":122,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:24:49.346598Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05798/citation-record","integrity":"/paper/2608.05798/integrity","json":"/paper/2608.05798/citation-record.json","paper":"/paper/2608.05798"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.884725Z","title":"Bitdance: Scaling autoregressive generative models with binary tokens, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.884725Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:39aa30a118189429a690028e9db8bbbb6a3de4e918a442892816bb2c2627a85b","observation_id":"738a38b0-545f-4185-a25e-5273ff6c1ee1","resolution":{"observed_at":"2026-08-07T23:24:48.884725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.890347Z","title":"OmniDoc-TokenBench","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.890347Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:bb53c64c2d537146107e0965a51a312300ffc22a55b6cfe95d3f7c8b53a2615a","observation_id":"2cf5ec29-295d-4960-8f0d-451f2c896b44","resolution":{"observed_at":"2026-08-07T23:24:48.890347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.895514Z","title":"AOM Common Test Conditions v5.0","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.895514Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:8ae8908367b447bba10c8c0e410d9d9947a4379c1beef25e24640c3267bd4ceb","observation_id":"58e03af8-44a4-4176-9f42-fb71009e891d","resolution":{"observed_at":"2026-08-07T23:24:48.895514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.900423Z","title":"Kandinsky 5.0: A family of foundation models for image and video generation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.900423Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:9a6fb3ee33efa3bf8ab58aa03ce40190a7cc88bd6362c6ec2ed8f0162014dff9","observation_id":"e0c328e6-e129-4c3b-94e2-3bc18372faf5","resolution":{"observed_at":"2026-08-07T23:24:48.900423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.905419Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.905419Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:8871b48a0afce1fba49fc673ea9d540f26666c31f5743f05deeadeec9db08a12","observation_id":"1c9e3033-ed5a-4ebb-b5c2-9c9bc343525b","resolution":{"observed_at":"2026-08-07T23:24:48.905419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.915306Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.915306Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:70056b82d776c71016c5462f4d82c5535d3e2898c57c3172a2d28a2298179cd6","observation_id":"e7aec70c-cff9-4657-95a8-14e5ec270626","resolution":{"observed_at":"2026-08-07T23:24:48.915306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.919954Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.919954Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:579b2f1549be950d39bb63a272d4eb5b567f9e007b520e1c9ef5408e731d6d38","observation_id":"f4e01222-a462-47f1-8769-f251b1d97829","resolution":{"observed_at":"2026-08-07T23:24:48.919954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.924532Z","title":"Bruinsma, Ana Lucic, Megan Stanley, Anna Vaughan, Johannes Brandstetter, Patrick Garvan, Maik Riechert, Jonathan A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.924532Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:4a1441eb4077b2b81b718a17578e9e3f76126e49f5c3e270fdfd56f863d9dc46","observation_id":"08a77cb1-62c7-4212-be39-0d505c00db6c","resolution":{"observed_at":"2026-08-07T23:24:48.924532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.929922Z","title":"Bradley and Milton E","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.929922Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:927a3c9f0a6087e907a68e29e949bca27c2b5d59a2fd3b228db6d65c62a2d3b4","observation_id":"2d1a6791-9ac9-4d11-a4a2-c6189f7f9025","resolution":{"observed_at":"2026-08-07T23:24:48.929922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.934742Z","title":"Efros, and Tero Karras","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.934742Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:a0a0f501d883bd6bc6d110cebac95d800c80c922ec9d5abb44b0b1ddfb10b5cc","observation_id":"1dafd9e2-d524-463c-8765-c667503a3beb","resolution":{"observed_at":"2026-08-07T23:24:48.934742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.939667Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.939667Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:df2368f804c86baaa498b274b07b539adf9cdf3d70bee5dee90cb6cab4a5a975","observation_id":"8f99be9f-2c46-4c89-a8e8-634720a099f3","resolution":{"observed_at":"2026-08-07T23:24:48.939667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.944198Z","title":"Deep compression autoencoder for efficient high-resolution diffusion models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.944198Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:a17f6e658b83d7b026a5580a3881578a08b1aa4ec0dfe153a872737725b240b3","observation_id":"ac82de2f-508f-42f8-94f2-b3442585c127","resolution":{"observed_at":"2026-08-07T23:24:48.944198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.948798Z","title":"Dc-videogen: Efficient video generation with deep compression video autoencoder, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.948798Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:7048c58d13b05545c06139e125b99a6ee76f10bf3c474adea86aa4c02a4273cb","observation_id":"a01b3ac9-6c80-4101-a447-d258f2d05261","resolution":{"observed_at":"2026-08-07T23:24:48.948798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.953175Z","title":"Dc-ae 1.5: Accelerating diffusion model convergence with structured latent space, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.953175Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:6cf082fa09424cb7ca550890cb1415b0b3de6e669c4e398f8bd8b9a20d6f74c1","observation_id":"66f14d0a-fbab-440d-9a23-60e4be4f9113","resolution":{"observed_at":"2026-08-07T23:24:48.953175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15322","last_updated":"2025-04-07T18:00:00Z","snapshot_observed_at":"2026-08-03T17:32:04.376468Z","submitted_at":"2024-12-19T18:59:55Z","title":"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15322","snapshot_observed_at":"2026-08-07T23:24:48.957682Z","title":"Taming multimodal joint training for high-quality video-to-audio synthesis.arXiv preprint arXiv:2412.15322, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.957682Z"},"links":{"cited_paper":"/paper/2412.15322","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:bab4c9eb8cc60267dd9e19065ee0ee0599597f580fb875e78be08a3f44d086c6","observation_id":"8cfa0b25-621d-4ebf-a247-cdecb6287abc","resolution":{"observed_at":"2026-08-07T23:24:48.957682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.962483Z","title":"Chien, Liuzixuan Lin, Hai Nguyen, Varsha Rao, Tristan Sharma, and Rajini Wijayawardana","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.962483Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:1a68e9dcba1d09eeb31067359fce6c5b7896ac2130bd2dcd43f2b42fe0a63792","observation_id":"39300b56-8bb8-49ca-a936-b46c8e8fdf26","resolution":{"observed_at":"2026-08-07T23:24:48.962483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.966861Z","title":"Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.966861Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:20176627b9e579983b2392c72607f661a91b2c550ec01d47df9cb3c8cba4d38e","observation_id":"3208e4f5-b9a4-4f4e-9113-e86893969d43","resolution":{"observed_at":"2026-08-07T23:24:48.966861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.971343Z","title":"Adversarial video generation on complex datasets, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.971343Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:519d0e3f92f68c58342f60ebb90d8f0594454184050a5912188b5277dd68a9a2","observation_id":"68383886-6f37-4b0b-8661-df2658afe5cf","resolution":{"observed_at":"2026-08-07T23:24:48.971343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T23:24:48.975675Z","title":"High fidelity neural audio compression.arXiv preprint arXiv:2210.13438, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.975675Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:1829b26bee0fb4800961bf63b24deb7150a09fe1cd065619d817283d97406a1b","observation_id":"81dcc4f3-3506-4684-ad39-9ab84632b47e","resolution":{"observed_at":"2026-08-07T23:24:48.975675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.980726Z","title":"Irc-gan: Introspective recurrent convolutional gan for text-to-video generation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.980726Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:32a47ad62c175d303031305aedb20610da67c821475d24eb5e42f206d43704c3","observation_id":"79456876-3f1f-4d7b-b238-e098f9074619","resolution":{"observed_at":"2026-08-07T23:24:48.980726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.985253Z","title":"Taming transformers for high-resolution image synthesis, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.985253Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:479905ab3f620b8987d2f06afeff4914c2847c05d5d969dd9545d30f248e24d1","observation_id":"90a9e832-bdce-496d-afdd-d01c2ade3351","resolution":{"observed_at":"2026-08-07T23:24:48.985253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14358","last_updated":"2024-07-31T16:22:42Z","snapshot_observed_at":"2026-08-06T16:30:00.821754Z","submitted_at":"2024-07-19T14:40:23Z","title":"Stable Audio Open","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14358","snapshot_observed_at":"2026-08-07T23:24:48.989694Z","title":"Parker, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.989694Z"},"links":{"cited_paper":"/paper/2407.14358","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:20987a6677e7fc5481b970639b4b6ce461bdf1014458562ad58402f06fe41e1c","observation_id":"4502afe0-0465-4f0f-9d01-890af4e52d42","resolution":{"observed_at":"2026-08-07T23:24:48.989694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.994502Z","title":"Parker, Matthew Rice, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.994502Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:eda482d44b0ceb8be269190a39776fa94e8286d49cfa0a2c0225a7698f04cead","observation_id":"5b1c7234-92ae-487b-b756-b6f47c997c35","resolution":{"observed_at":"2026-08-07T23:24:48.994502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:48.998841Z","title":"The prism hypothesis: Harmonizing semantic and pixel representations via unified autoencoding, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:48.998841Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:8399aa09bfe65120367d69e09f0b795e92aae43f6cf52d86067a4ef5c25d1d35","observation_id":"42f007fe-896c-4768-a598-b7200889aeab","resolution":{"observed_at":"2026-08-07T23:24:48.998841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.003333Z","title":"Gemmeke, Daniel P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.003333Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:0a2f33e0f20fc54269ea2970dfedf97a50e263e93417738a49b6e9d562b3891b","observation_id":"9afbd4dd-4573-449e-b4c3-10ea5566898c","resolution":{"observed_at":"2026-08-07T23:24:49.003333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.007973Z","title":"BigVGAN: A universal neural vocoder with large-scale training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.007973Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:3ccdc5e7489457770810188ec516d306c30e6d115bbff19ea787d36a325d104a","observation_id":"6fe1651f-184c-4137-a0e1-f14a18e6255a","resolution":{"observed_at":"2026-08-07T23:24:49.007973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.012406Z","title":"Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron Courville, and Yoshua Bengio","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.012406Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:ff12dbb53241ad1b9921de1233acb3e6fc1f79ff292e74a4c574a4cf693145cd","observation_id":"cc499c7a-24e3-4967-9a5e-f6aaf1ad7721","resolution":{"observed_at":"2026-08-07T23:24:49.012406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.016907Z","title":"Veo 3.1: Our leading video generation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.016907Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:cf44db096234559289571b94ac18f84eefd24b401d9f87942180c7b909234ee6","observation_id":"aee2644b-0f0f-44a3-ac52-1f0c0a3d1f37","resolution":{"observed_at":"2026-08-07T23:24:49.016907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.021526Z","title":"Ltx-2: Efficient joint audio-visual foundation model, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.021526Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:613721cc7122d3d10e810fa06e45a2cb19364f2c6e59d166adca3cbb1421f572","observation_id":"b3bd5b17-09ff-45ff-9cea-0b4fa494d047","resolution":{"observed_at":"2026-08-07T23:24:49.021526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.026296Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.026296Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:60c85009f65f2cb9df05dc17d2153a23833e18905137c7ad149feccbcec12ce4","observation_id":"d25e578e-3c43-4d82-b3b6-a4d102f65412","resolution":{"observed_at":"2026-08-07T23:24:49.026296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.031152Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.031152Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:2f218ebedaaa8dee66f24885a24b7fd3782f8ac7abae419272a7e461634330cc","observation_id":"51815ec0-39d4-4233-b438-7d728e498fc2","resolution":{"observed_at":"2026-08-07T23:24:49.031152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.035612Z","title":"Kingma, Ben Poole, Mohammad Norouzi, David J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.035612Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:4f2a95d2e29007daf9524942b142fa6ab92b5d39113d6e77ed4071c58ef54158","observation_id":"acfa54a4-7194-4056-9435-82f1d3aada79","resolution":{"observed_at":"2026-08-07T23:24:49.035612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.040278Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.040278Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:a538cc1eb8fee32e230ad63b2916fe54785e6314b5272ae16f49e2a21b9efcaa","observation_id":"ac1880fa-d3b4-45ba-b19f-e5d33fbb0059","resolution":{"observed_at":"2026-08-07T23:24:49.040278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.045380Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.045380Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:cce7d1612e80d784c2e07751c924f64a1238abfe0b37002d4c622c90dcfda00a","observation_id":"74b0e03a-b622-43c5-9b45-0d0faf6572eb","resolution":{"observed_at":"2026-08-07T23:24:49.045380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.049876Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.049876Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:ed2d5fc8d3b3ce0714b96c2bb311577bf445d8eee231b71e746c439fbd96ecad","observation_id":"388dabe9-9483-4020-a64f-bf40609068c2","resolution":{"observed_at":"2026-08-07T23:24:49.049876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.055309Z","title":"Perceptual evaluation of speech quality (PESQ).International Telecommunication Union, 2001","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.055309Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:aee4e89933e03a6d89c9f69cef1cfc927b61c11a145e40e17dafd4937f5f10b5","observation_id":"62f3ccf0-45f6-46a3-bae0-92d1aad6f2da","resolution":{"observed_at":"2026-08-07T23:24:49.055309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.059886Z","title":"Video pixel networks, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.059886Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:1e1856b309d521bfd356707e70b52475b1ef161eb475e7c2125d4f7a711c1846","observation_id":"2f138c9e-758c-405e-b102-950da176a488","resolution":{"observed_at":"2026-08-07T23:24:49.059886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.064527Z","title":"Fréchet audio distance: A reference-free metric for evaluating music enhancement algorithms.Interspeech,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.064527Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:6cd520f9fecdf472feda7dce43520a019e7428028a15f8de44f860a0fd8e2165","observation_id":"2b8624e0-78ca-499b-bff4-74489982f7a5","resolution":{"observed_at":"2026-08-07T23:24:49.064527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.069235Z","title":"AudioCaps: Generating captions for audios in the wild","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.069235Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:807aa47c875ee8cf37b4d5946be0e37be69954ea4c733f994fe4c6e342cab160","observation_id":"232dab4f-1757-46a5-87c7-363c5b97a577","resolution":{"observed_at":"2026-08-07T23:24:49.069235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.073665Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.073665Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:f30278b867fd993de71b6c9b2c80fe22c2fec2c9b93b507dc45266417c024b4f","observation_id":"9cddac63-115e-4f59-b7dc-a7ff81cc025e","resolution":{"observed_at":"2026-08-07T23:24:49.073665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.078139Z","title":"Auto-encoding variational bayes, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.078139Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:464fef33b6d727cc8d924e279959bc9a78ee3c477a71de1ed7b09401b941a14a","observation_id":"ac8ebf5b-0045-4547-8dd7-3bdecc1b4e8b","resolution":{"observed_at":"2026-08-07T23:24:49.078139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.082831Z","title":"Klingai enters the 3.0 era: All in one, one for all! kling 3.0 model now fully rolled out","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.082831Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:8f507d058cc2317197b8773e9bcb8732f017a239fdf9805884b5238d11f9357f","observation_id":"eed9165a-132b-46a2-9a61-0628ff3086bd","resolution":{"observed_at":"2026-08-07T23:24:49.082831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.087019Z","title":"Carbon Emissions in the Tailpipe of Gen- erative AI.Harvard Data Science Review, 15(Special Issue 5), aug 20 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.087019Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:cd1b3873e23781edf3e4c17df5ef2c367b7057af928aa5e9df0de496709555f4","observation_id":"c3bfd2f4-fbfe-402a-bb65-80e0edfc4a3e","resolution":{"observed_at":"2026-08-07T23:24:49.087019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.091331Z","title":"Ross, Bryan Seybold, and Lu Jiang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.091331Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:ecb589b24c8eaba8af47c12454c7a8b3f873259f1b223e216b0115df2b3d8c48","observation_id":"5c12fc1a-6a0c-4df5-9492-f8bdbf88ce97","resolution":{"observed_at":"2026-08-07T23:24:49.091331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.095870Z","title":"HiFi-GAN: Generative adversarial networks for efficient and high fidelity speech synthesis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.095870Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:ece62bda5342d774134fa42d649c33cbb35a75d1a2ff06fc0e0e1f89f0df8bc8","observation_id":"11284e29-edbb-49d5-a292-19aed98a3d65","resolution":{"observed_at":"2026-08-07T23:24:49.095870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:51.098763Z","title":"Plumb- ley","venue":null,"work_id":"a18e0f80-46bb-448d-a066-81e7d25dbcdd","year":2020},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.100167Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:eb9bf1d2a89596b2d090754210ea0b39baabad73f327e8223230ca58eac49375","observation_id":"6df06d21-2e6f-4c84-9e10-0f5f86539d0c","resolution":{"observed_at":"2026-08-07T23:24:51.103658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.105028Z","title":"Hunyuanvideo: A systematic framework for large video generative models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.105028Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:e09bec9e034f35c310ea04b116a6f4ac0c2611822db289a050b8fbcc047c393b","observation_id":"0aaa8769-e8f5-470d-a322-8fcd01577bca","resolution":{"observed_at":"2026-08-07T23:24:49.105028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:51.072947Z","title":"Kandinsky video tools","venue":null,"work_id":"ac3ae5ef-731a-419c-b0b7-4350a0c25b0e","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.109643Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:348ebbf34ce50bccd8915d0ddffb704ee3d348273c8ad04bda19516b912168ed","observation_id":"36e12cc6-4dc9-4036-9ac1-ee3691524038","resolution":{"observed_at":"2026-08-07T23:24:51.078140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:51.056506Z","title":"Efficient training of audio transformers with patchout","venue":null,"work_id":"5754c249-eb6a-45fc-8607-55a4c0669ea3","year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.114113Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:b5fee98adfe9589a9ce72758eb60859c575eed9c5d5709e1103cf216b56dbd00","observation_id":"31a7a776-c7af-4f4f-8bc8-1312dd7dcb93","resolution":{"observed_at":"2026-08-07T23:24:51.062027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:51.041599Z","title":"Eq-vae: Equivariance regularized latent space for improved generative image modeling, 2025","venue":null,"work_id":"1d1d2fc8-5271-40e7-bd3e-813c116b8b06","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.118762Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:8d60539f22c3700257f66063c1e57bf01db141f66a0f8b4f52ff8929924feef5","observation_id":"127290f6-9b74-49d9-b344-b37a41322fd7","resolution":{"observed_at":"2026-08-07T23:24:51.046580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:51.025866Z","title":"High-fidelity audio compression with improved RVQGAN","venue":null,"work_id":"48d16d7a-e131-4f10-96a2-c832e10e57c5","year":2023},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.123265Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:e4cc222c570bd73fb98711f2906976673d39f27e59ddac32c64df6bfb280822e","observation_id":"998362ab-e4c9-4bf6-a90c-0ca4b683a950","resolution":{"observed_at":"2026-08-07T23:24:51.031097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:51.010114Z","title":"REPA-E: Unlocking vae for end-to-end tuning of latent diffusion transformers","venue":null,"work_id":"d2d9fdaf-4f21-48f7-a372-10b7b83bac28","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.127893Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:6bd21ceb97127f5559d61d32a6992aee0779c4fab5493c4204583ce9361759b2","observation_id":"5848a0cc-c2f6-482d-954d-dfa79c488168","resolution":{"observed_at":"2026-08-07T23:24:51.015069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.24888","last_updated":"2026-06-23T17:59:55Z","snapshot_observed_at":"2026-08-08T16:38:03.178919Z","submitted_at":"2026-06-23T17:59:55Z","title":"DiffusionBench: On Holistic Evaluation of Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2606.24888","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.24888","snapshot_observed_at":"2026-08-07T23:24:50.091772Z","title":"DiffusionBench: On Holistic Evaluation of Diffusion Transformers","venue":"cs.CV","work_id":"b7598121-90ae-4e9e-9973-96d08b5e6961","year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.132533Z"},"links":{"cited_paper":"/paper/2606.24888","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:ec6d82927c77cafc3c80549ee1abda51b71c5b6e4cb9be9b9ee73f6acd742803","observation_id":"cc608454-847f-40a0-8459-3c9ccee14f2b","resolution":{"observed_at":"2026-08-07T23:24:50.096776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.994559Z","title":"Wf-vae: Enhancing video vae by wavelet-driven energy flow for latent video diffusion model,","venue":null,"work_id":"e7501998-9e03-456c-a747-6e872601ba1a","year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.137542Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:e3525e562d7dda67a6c040b633d18924e30aac23e3e788549ca6eaeb6a0d6dc2","observation_id":"83adf514-2156-4f71-a374-ffa46d3c452f","resolution":{"observed_at":"2026-08-07T23:24:50.999575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.979217Z","title":"Generating novel, designable, and diverse protein structures by equivariantly diffusing oriented residue clouds, 2023","venue":null,"work_id":"37ef3861-fafe-4d5e-b176-bd60fb8a0c96","year":2023},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.142269Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:893191cd08836e82533b4ad78dcaaecdf7f5e5557c85c8316d46c93249fe059d","observation_id":"e5363bd6-7328-439c-add9-f9aedcb225ab","resolution":{"observed_at":"2026-08-07T23:24:50.984146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05734","last_updated":"2024-05-11T11:24:51Z","snapshot_observed_at":"2026-08-07T06:58:30.754944Z","submitted_at":"2023-08-10T17:55:13Z","title":"AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05734","snapshot_observed_at":"2026-08-07T23:24:49.146653Z","title":"Plumbley","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.146653Z"},"links":{"cited_paper":"/paper/2308.05734","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:655dd6ae7ec1e6b38e634df690fa10c797ad712794787599c684b8a13ba71b27","observation_id":"267aeaba-7451-409e-b2f4-67858bde79ba","resolution":{"observed_at":"2026-08-07T23:24:49.146653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.05394","last_updated":"2026-07-24T07:04:43Z","snapshot_observed_at":"2026-08-03T18:25:53.262934Z","submitted_at":"2025-12-05T03:20:02Z","title":"Delving into Latent Spectral Biasing of Video VAEs for Superior Diffusability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.05394","snapshot_observed_at":"2026-08-07T23:24:49.151448Z","title":"Delving into latent spectral biasing of video vaes for superior diffusability.arXiv preprint arXiv:2512.05394, 2025.https://arxiv.org/abs/2512.05394","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.151448Z"},"links":{"cited_paper":"/paper/2512.05394","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:4099bf25d3f4239c3e44ad90b567586b455c8c82defe5526eee4df004a7eb168","observation_id":"66ca06a4-e630-4e22-b35d-8cac8283534a","resolution":{"observed_at":"2026-08-07T23:24:49.151448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.964292Z","title":null,"venue":null,"work_id":"b15810a2-d0ca-4423-b6cb-3a0961b3a133","year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.156389Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:5103dc8705fccd2b3a6cb5253355932f0c826d17187664aa2ddeca521aad34ed","observation_id":"acc391df-336e-415e-be70-460d0f658a11","resolution":{"observed_at":"2026-08-07T23:24:50.969040Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.949735Z","title":"The song describer dataset: A corpus of audio captions for music-and- language evaluation","venue":null,"work_id":"04747316-9c58-4648-82d0-7ace3cb0b0d9","year":2023},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.160855Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:e49fd6ea8c8ccde38fae03ac774d24153ed565160f6fb280715c918c98b7b2cd","observation_id":"b4353548-027b-4ca2-a114-f6b0f9e70e21","resolution":{"observed_at":"2026-08-07T23:24:50.954476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.934584Z","title":"Balasubramanian","venue":null,"work_id":"e07a2dfe-326d-4c04-8c10-5d3b7e8740db","year":2017},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.165459Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:82a005dc3f3ea39e57c4a2553a9a82e4c3e242c05bdca6fccb84f08caebaac1a","observation_id":"c0d76d52-e54f-48d8-a3be-b4b6bbb0005b","resolution":{"observed_at":"2026-08-07T23:24:50.939257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.920295Z","title":"Transition matching distillation for fast video generation, 2026","venue":null,"work_id":"9b0b1938-b39d-4816-a494-dd49602de6eb","year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.170003Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:f0ba3643350a6a558928b4f9a0ed692e26f4674dee19dc94b9504ea5994d7a46","observation_id":"b51194c7-d6ad-4f0a-8fe1-844428a199cb","resolution":{"observed_at":"2026-08-07T23:24:50.924914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.174272Z","title":"Blaschko, Albert Ali Salah, and Itir Onal Ertugrul","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.174272Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:9607f7cac1736bc2d123781ba4422890e911cf4e18e46919317bc1b7253932e3","observation_id":"d1a2b48e-5f39-4930-9d4b-2590079c194c","resolution":{"observed_at":"2026-08-07T23:24:49.174272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.905157Z","title":"Alpamayo-r1: Bridging reasoning and action prediction for generalizable autonomous driving in the long tail, 2026","venue":null,"work_id":"7c030b10-0546-4dca-b024-6fc51a9d4c95","year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.178680Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:a5e8c5d8404275e31676dddca4427a9ca58192f3d57b7e05988306ef0115f8da","observation_id":"81b25390-cc78-405e-975f-b87ef68d0aea","resolution":{"observed_at":"2026-08-07T23:24:50.910624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-07T23:24:49.183042Z","title":"Cosmos tokenizer: A suite of image and video neural tokenizers.arXiv preprint arXiv:2501.03575, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.183042Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:573f7129da53c218041afa56c22da9247fbf98ec166053641ab08d419bfd4609","observation_id":"6377f506-b873-48fb-9081-51f4cfa0c397","resolution":{"observed_at":"2026-08-07T23:24:49.183042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.890305Z","title":"To create what you tell: Generating videos from captions, 2018","venue":null,"work_id":"0a57e3c5-6295-447e-b6f7-9e6c277fe74f","year":2018},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.187278Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:7d27ca7e2f461cdfbe867185ebff2877f5d14af49e9c32185281da3450f1bd0b","observation_id":"800b8ce9-b089-4322-971e-87cb2867cc2f","resolution":{"observed_at":"2026-08-07T23:24:50.895129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.875363Z","title":"Librispeech: An ASR corpus based on public domain audio books","venue":null,"work_id":"47214ece-95ec-4c2c-b29b-941d3bfe704f","year":2015},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.192154Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:e5046367bbf2a4dd111816b427b2b80f67cd01af3013f86025eba85b3f3a8422","observation_id":"bbe6bb1f-7dfe-4235-8b32-0602637df5de","resolution":{"observed_at":"2026-08-07T23:24:50.880432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.859815Z","title":"Parker, Zach Evans, CJ Carr, Zack Zukowski, Josiah Taylor, Matthew Rice, and Jordi Pons","venue":null,"work_id":"ab9b947a-4bac-4a99-bde1-cf916c5ae6c0","year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.196758Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:8a2521696a8234d0c6a6224a56c3cd61eea10ffadae31f9b3bb274cd6fb1a040","observation_id":"be565eb9-cfe7-46b6-bb9b-8be96549aa1e","resolution":{"observed_at":"2026-08-07T23:24:50.864864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.843905Z","title":"Sampson, Shikai Li, Simone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petrovic, and Yuming Du","venue":null,"work_id":"748c1391-18a3-4b00-a847-628543c9c0b4","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.201249Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:d00e046c2e4ad6740b0a982c48a02b5896903e91eae8bcdbffd087490ed41c4f","observation_id":"8b31fb12-eda1-4f4a-bf0f-82d1d1e71768","resolution":{"observed_at":"2026-08-07T23:24:50.849477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.828501Z","title":"Andersson, Andrew El-Kadi, Dominic Masters, Timo Ewalds, Jacklynn Stott, Shakir Mohamed, Peter Battaglia, Remi Lam, and Matthew Willson","venue":null,"work_id":"2e9f33a3-03c2-4993-b23c-dcafec5058a6","year":2024},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.205992Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:11aeb517667cc2e023d6b2c0ab1060d810cf1dcb66ffaabaf41b1fdcb5592751","observation_id":"ca168e10-08e7-4eab-87da-b326e642041e","resolution":{"observed_at":"2026-08-07T23:24:50.833535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.11738","last_updated":"2026-07-13T16:00:03Z","snapshot_observed_at":"2026-08-06T12:36:13.363835Z","submitted_at":"2026-07-13T16:00:03Z","title":"Qwen-Audio-VAE Technical Report","version":1},"cited_work":{"arxiv_id":"2607.11738","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.11738","snapshot_observed_at":"2026-08-07T23:24:49.818623Z","title":"Qwen-Audio-VAE Technical Report","venue":"eess.AS","work_id":"eaffe9c7-dd1f-4307-8cf5-8cda33cc4413","year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.210558Z"},"links":{"cited_paper":"/paper/2607.11738","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:5b418c78375416a0d412864feb010f3bb1d9c14ad4bf1dc7c217deb3c9729592","observation_id":"0ff90aab-604b-4284-bacd-ad48092a822b","resolution":{"observed_at":"2026-08-07T23:24:49.823936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13565","last_updated":"2026-05-13T14:04:56Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T14:04:56Z","title":"Qwen-Image-VAE-2.0 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13565","snapshot_observed_at":"2026-08-07T23:24:49.215146Z","title":"Qwen-Image-V AE-2.0 technical report.arXiv preprint arXiv:2605.13565, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.215146Z"},"links":{"cited_paper":"/paper/2605.13565","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:bd6947dba1da943996555c6b81ff742973e4b144c2ebcdd886520e7639b2f02c","observation_id":"396ca9dd-f10f-4d1b-9a33-54a7aca03ca7","resolution":{"observed_at":"2026-08-07T23:24:49.215146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.812547Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"5c663a1f-d7e4-4249-afdb-2dfb4fb6043e","year":2021},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.219882Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:b79d6ce7960b8ecc9d6c50cdff225ad8ec1f285fd26179cb4a83a15b9cf1353b","observation_id":"a1a0de29-3159-47e1-bae3-88f9a00de7e8","resolution":{"observed_at":"2026-08-07T23:24:50.817684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.797494Z","title":"MUSDB18-HQ — an uncompressed version of MUSDB18, 2019","venue":null,"work_id":"72c68c90-cfd1-41a8-843b-4517c84aec59","year":2019},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.224296Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:1f543dabbc34df2bd47e14834cc70d048e303ff62b6832035855e446b1aded09","observation_id":"56dab5a3-9387-4627-a2a5-79b447587466","resolution":{"observed_at":"2026-08-07T23:24:50.802189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.782113Z","title":"EARS: An anechoic fullband speech dataset benchmarked for speech enhancement and dereverberation","venue":null,"work_id":"56263467-c70e-4634-8dfb-1820e748588d","year":2024},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.228947Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:45e3709955c7d4d8f5ae66b073a4d1b86db5aee85f856992907e461456c17d84","observation_id":"403980d2-0bb7-4e58-8a4e-b51a022855e0","resolution":{"observed_at":"2026-08-07T23:24:50.787304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.767713Z","title":"High-resolution image synthesis with latent diffusion models, 2022","venue":null,"work_id":"4532dd83-1815-431c-ad8a-73b6fc5fd959","year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.233612Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:c11518ca163ef57d2c8a41a66918149668c5186f93e04daf55025398cdc10d3d","observation_id":"908a6963-34df-4061-9ae6-a918534a033b","resolution":{"observed_at":"2026-08-07T23:24:50.772663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.752480Z","title":"High-resolution image synthesis with latent diffusion models, 2022","venue":null,"work_id":"c58b8bc7-7133-4313-85a0-81db5a07966d","year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.238165Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:ae659918917780daa7551538892e9bb2d4ea10f022c8096caf7f98b21203f320","observation_id":"df019351-9721-4388-8474-f420028c64c2","resolution":{"observed_at":"2026-08-07T23:24:50.757578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.737352Z","title":"Runway gen-4: Ai video generation with world consistency","venue":null,"work_id":"413a28a8-4ae4-4a4c-b232-ce89a5ba47ba","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.242655Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:257eadbf9af97ec733993403070a715ee6814c7e0a6716c5a934b039e6d5b8e6","observation_id":"d2ee0a73-a87d-4d66-8420-375818288256","resolution":{"observed_at":"2026-08-07T23:24:50.742254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.720801Z","title":"Flow to the mode: Mode-seeking diffusion autoencoders for state-of-the-art image tokenization, 2025","venue":null,"work_id":"73fe519a-0e0d-4796-8906-19b545477750","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.246801Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:2138ebb468ddfe1ddacba5ece05152921623cd1b7456eae9dc219e2a5d45a40b","observation_id":"1381ca67-e28f-4a49-b640-88ed3f1cd99e","resolution":{"observed_at":"2026-08-07T23:24:50.725842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.705125Z","title":"Make- a-video: Text-to-video generation without text-video data, 2022","venue":null,"work_id":"822133ed-b162-4bc1-94b5-22fe7ac16bb9","year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.251220Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:47fc96001c841045312f1d38cee632f51f665763977ea6ca89fa88b0f3dd1e67","observation_id":"f28f6329-029f-4897-a6f0-4573d0b56e2d","resolution":{"observed_at":"2026-08-07T23:24:50.710306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:49.255842Z","title":"What matters for representation alignment: Global information or spatial structure?arXiv preprint arXiv:2512.10794, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.255842Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:9f3e08f9798d2bf8301c4cf71d6190c173b0566da1be3ab17ffba6d3791124b4","observation_id":"a188e79e-5a70-4a33-b517-84db242a8fa8","resolution":{"observed_at":"2026-08-07T23:24:49.255842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.689133Z","title":"Improving the diffusability of autoencoders, 2025","venue":null,"work_id":"00d3b018-ff7f-4380-a2f4-c11e859aa071","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.260320Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:510a49a4a8df3dedfd1346c72630a102e0729855ed0da765d2e2da19f2037491","observation_id":"6cc40914-4d56-4056-b59a-1fdd5dd4ac21","resolution":{"observed_at":"2026-08-07T23:24:50.693904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.673748Z","title":"Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2, 2022","venue":null,"work_id":"007305c7-2192-4d26-939e-27e081519247","year":2022},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.264895Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:556e12e8c27dfe21c06af0c4255c2f546e859ebc534a6fdd1d366c1f3f7d6671","observation_id":"76dfbbe9-c306-4d70-bad0-2e7965de56f9","resolution":{"observed_at":"2026-08-07T23:24:50.678729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.658086Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild, 2012","venue":null,"work_id":"6eff45d2-354b-4bd7-9615-a6fe6ccfa106","year":2012},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.269466Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:ac5b4a06dda3cf1100cda39d83b4cc6103a923ad74d2d59c24c91309dda22e5b","observation_id":"8570bb5d-e8b1-4fe9-8313-b7bdf698ea11","resolution":{"observed_at":"2026-08-07T23:24:50.663478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.643160Z","title":"Scenediffuser++: City-scale traffic simulation via a generative world model, 2025","venue":null,"work_id":"67e93ecb-d16d-4f92-8678-e3d7faed7c61","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.273993Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:e024dce95d99443960171af203a2492f7470412aade8b046297557d1f8ef6943","observation_id":"19383de8-b3f2-4913-8671-bc2eb2dd16c3","resolution":{"observed_at":"2026-08-07T23:24:50.647889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.627903Z","title":"Z-image: An efficient image generation foundation model with single-stream diffusion transformer,","venue":null,"work_id":"3de892ba-b630-44a5-be76-292497e84f4c","year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.278379Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:e86226558d3265959d61ff081b859d7624ca7571d2b30679d7e5455a4564d8c2","observation_id":"95573368-f86d-4172-9e9e-868bfa40d269","resolution":{"observed_at":"2026-08-07T23:24:50.632963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.612890Z","title":null,"venue":null,"work_id":"ed7fbc8b-83bb-43a8-ad15-ac25ceee6f01","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.282806Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:af3f1fe7af2f7386d806897b8e851a7f8b31f553c4401afb30356c54a092ae70","observation_id":"5405c1df-101f-4983-925d-d8fbf8ec6146","resolution":{"observed_at":"2026-08-07T23:24:50.617480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.597978Z","title":"Nextstep-1: Toward autoregressive image generation with continuous tokens at scale, 2025","venue":null,"work_id":"56d87a36-4cd0-402e-9f34-2c99a979272a","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.287263Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:575523d5fd4596325826878207c0933e345a482f8f5cfc1ade24dcf671e959c9","observation_id":"49e126f2-5c89-408a-bd6a-c64e1f68d805","resolution":{"observed_at":"2026-08-07T23:24:50.602974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16930","last_updated":"2025-08-23T07:30:18Z","snapshot_observed_at":"2026-08-07T20:59:21.703704Z","submitted_at":"2025-08-23T07:30:18Z","title":"HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.16930","snapshot_observed_at":"2026-08-07T23:24:49.291826Z","title":"HunyuanVideo-Foley: Multimodal diffusion with representation alignment for high-fidelity foley audio generation.arXiv preprint arXiv:2508.16930, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.291826Z"},"links":{"cited_paper":"/paper/2508.16930","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:6b2f5eda859c5d8f973ac13bda3427ddc4b790b1abb149b9a357aeb7f32b2c2b","observation_id":"54f8ed22-adc4-477d-aa77-894691e0c336","resolution":{"observed_at":"2026-08-07T23:24:49.291826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.583142Z","title":"Reducio! generating 1k video within 16 seconds using extremely compressed motion latents, 2025","venue":null,"work_id":"95d84b43-809c-47ed-8f94-10a5990f71b0","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.296716Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:9a1dc437c048d726708fe8c45727dcaa4f3de86cd695f2ff5dd9500aecddb9b6","observation_id":"fa0cbf27-e6fc-431d-af41-a2baebeba92c","resolution":{"observed_at":"2026-08-07T23:24:50.587939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.568506Z","title":"Metaxas, and Sergey Tulyakov","venue":null,"work_id":"35f00957-a501-46c6-8431-b281628bd616","year":2021},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.301476Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:3a4ab6a68de50c685d71375fc99a8b4cd645bd2c96015cb5f32e6b2740faa526","observation_id":"efee10b7-6d58-44ed-b07b-e9ab1e95acaf","resolution":{"observed_at":"2026-08-07T23:24:50.573136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-07T23:24:49.306053Z","title":"Meta audiobox aesthetics: Unified automatic quality assessment for speech, music, and sound","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.306053Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:c7fd67d75fa4c5d8aeaee9f3fb68b0e2897eae111e9994ca960dcaf9e54d0eb9","observation_id":"23c4e403-bc4d-43c7-8fee-7ada83688ad1","resolution":{"observed_at":"2026-08-07T23:24:49.306053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.553952Z","title":"Ssdd: Single-step diffusion decoder for efficient image tokenization, 2026","venue":null,"work_id":"13052c53-b090-435a-b9c2-64392db8a66b","year":2026},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.310789Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:ce0681e2c863c4a6fa5e8631d932ff550a569ceeb7b1c86d92227e256b8ea449","observation_id":"efeb5b68-bd37-45d3-a383-dc5adebe7538","resolution":{"observed_at":"2026-08-07T23:24:50.558721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.539325Z","title":"Conditional image generation with pixelcnn decoders, 2016","venue":null,"work_id":"bcc3b82c-a48b-482f-8f4d-d23b60b3a3fb","year":2016},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.315228Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:136b8fbea676601446e4d60c818c372eecfe382039333ab67d8acf8dcb334c3e","observation_id":"f8046108-5b8b-4da1-b9d0-9f8cde99f1d4","resolution":{"observed_at":"2026-08-07T23:24:50.544106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.524812Z","title":"Neural discrete representation learning, 2018","venue":null,"work_id":"7fb3e2eb-21f9-450d-9258-c98d5eef6db5","year":2018},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.319830Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:53422dbe76194a6acd555a61cad4d19d4befea59515de4aa4a3c9c7ac15d0f0e","observation_id":"235a4e58-ae68-4a14-8a35-8677b551f010","resolution":{"observed_at":"2026-08-07T23:24:50.529444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.510185Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"9e1569cf-f5e6-44c0-8081-9ff4b787e239","year":2023},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.324257Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:f43f045f69631950a5000d80d9899227d84f30a78dbf9d0bf116440d37bc6347","observation_id":"fcb04103-a5e0-40db-82c6-a454a4cc5187","resolution":{"observed_at":"2026-08-07T23:24:50.514926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.494721Z","title":"Generating videos with scene dynamics, 2016","venue":null,"work_id":"6115c9b0-94ec-49c0-baa1-579f92b2f118","year":2016},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.328663Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:1dc07c805e9d9cc4163dbb289f4f086f88f22914eb37468306462425a898ab57","observation_id":"2283e7e1-6c9b-45bc-a3ee-a12990febe3d","resolution":{"observed_at":"2026-08-07T23:24:50.499693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.480274Z","title":"Wan: Open and advanced large-scale video generative models, 2025","venue":null,"work_id":"2d755a35-a8cc-4076-8252-392dc58f28ee","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.333015Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:735f1afccaa80c41382e350be792b8fc2729e4233e519d29b184ee6e7233dbef","observation_id":"3d01af25-d7ad-4d26-9e55-82118e8e8c08","resolution":{"observed_at":"2026-08-07T23:24:50.484897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.466139Z","title":"Wan-2.2 anouncement","venue":null,"work_id":"4891d4f4-1023-4828-82aa-2f6931b5108a","year":2025},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.337918Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:6d6e487c973b66d93430f4a307c2fa70495688908d372571c61b623e0a76c534","observation_id":"69657ab6-1c35-43ea-8ef2-6a4476db2986","resolution":{"observed_at":"2026-08-07T23:24:50.470707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.451861Z","title":null,"venue":null,"work_id":"44a6abc7-f84b-413a-8ec6-9368ccf62d4c","year":2016},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.342282Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:fb4ed07a5cf5599764f45c01fd29ddcbac98f4ffb9e843826ca170a8f340ad95","observation_id":"76571650-0562-4483-9884-118e27a89523","resolution":{"observed_at":"2026-08-07T23:24:50.456314Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:24:50.437615Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"02329911-68f2-428a-8f73-956ab17c6976","year":null},"citing_paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T23:24:49.346598Z"},"links":{"citing_paper":"/paper/2608.05798"},"observation_digest":"sha256:642234456cf8bbef31639ad8de62fb489ef244f6eba4efca7d9cda2117d4df78","observation_id":"56c741e4-ba26-43b8-a506-dd18820a4bb4","resolution":{"observed_at":"2026-08-07T23:24:50.442381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.05798","last_updated":"2026-08-06T09:34:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T03:10:57.767280Z","submitted_at":"2026-08-06T09:34:00Z","title":"KVAE: Family of Tokenizers for Multimodal Generative Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":2,"verified_fuzzy":41},"total_outbound_references":122},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 122 outbound references and 0 inbound Pith citation observations for arXiv:2608.05798."}