{"as_of":"2026-08-09T21:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:08cb1d39de90297e0073c7c2b9ef8f506c0f2fd45cab5dc8ef36e89f9828701a","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:32:54.917657Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T06:04:18.168577Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T15:17:07.216858Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07997","snapshot_observed_at":"2026-08-05T06:04:18.168577Z","title":"MGVQ: Could VQ-VAE beat VAE? a generalizable tokenizer with multi-group quantization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07996","last_updated":"2026-07-20T17:34:32Z","snapshot_observed_at":"2026-08-07T09:38:31.708978Z","submitted_at":"2025-09-04T17:59:58Z","title":"3D and 4D World Modeling: A Survey","version":4},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-05T06:04:18.168577Z"},"links":{"cited_paper":"/paper/2507.07997","citing_paper":"/paper/2509.07996"},"observation_digest":"sha256:4a1a255e0abd8d1f68d584b1d8f14c323918c580c0396fc7aa9c2799f44535dc","observation_id":"7c01e3d7-73bc-4b35-a488-e6b6a6cfea42","resolution":{"observed_at":"2026-08-05T06:04:18.168577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"cited_work":{"arxiv_id":"2507.07997","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07997","snapshot_observed_at":"2026-07-02T15:17:07.216858Z","title":"arXiv preprint arXiv:2507.07997 (2025) 4, 7","venue":null,"work_id":"998b7447-d637-4bfa-a853-0f816138174f","year":2025},"citing_paper":{"arxiv_id":"2605.18115","last_updated":"2026-05-18T09:24:39Z","snapshot_observed_at":"2026-08-06T04:43:08.432770Z","submitted_at":"2026-05-18T09:24:39Z","title":"WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T12:04:19.761430Z"},"links":{"cited_paper":"/paper/2507.07997","citing_paper":"/paper/2605.18115"},"observation_digest":"sha256:d6a5184e50ec0495d871685d93a66a212f28f307100c9d487da8b1414e380996","observation_id":"50a07cdc-b07c-495d-98c9-64ee84f7d604","resolution":{"observed_at":"2026-05-20T12:08:15.852478Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"cited_work":{"arxiv_id":"2507.07997","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07997","snapshot_observed_at":"2026-07-02T15:17:07.216858Z","title":"arXiv preprint arXiv:2507.07997 (2025) 4, 7","venue":null,"work_id":"998b7447-d637-4bfa-a853-0f816138174f","year":2025},"citing_paper":{"arxiv_id":"2607.00371","last_updated":"2026-07-01T03:11:21Z","snapshot_observed_at":"2026-08-02T15:32:07.000409Z","submitted_at":"2026-07-01T03:11:21Z","title":"MEPA: Multi-Scale Representation Alignment for Visual Autoregressive Modeling with Mixture of Experts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-02T15:14:36.946247Z"},"links":{"cited_paper":"/paper/2507.07997","citing_paper":"/paper/2607.00371"},"observation_digest":"sha256:0a9568876a08e678d3cd91e64a9029c9986ccf27300593eded99041c5e9f8446","observation_id":"6d0577c1-f2bb-47c1-bb07-b7dfcc55092e","resolution":{"observed_at":"2026-07-02T15:17:07.218280Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07997","snapshot_observed_at":"2026-08-01T17:35:37.149410Z","title":"Mgvq: Could vq-vae beat vae? a generalizable tokenizer with multi-group quantization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17585","last_updated":"2026-07-22T07:24:13Z","snapshot_observed_at":"2026-08-06T07:20:20.809986Z","submitted_at":"2026-07-20T06:04:08Z","title":"Pixel-Space Diffusion Transformers","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-01T17:35:37.149410Z"},"links":{"cited_paper":"/paper/2507.07997","citing_paper":"/paper/2607.17585"},"observation_digest":"sha256:4b60ae609ce6558e195e29c2d9f358e1a01ca6ebd3e2b54b592d5ba361f619d4","observation_id":"1558fa2a-89c4-46f2-a51f-3476eed44741","resolution":{"observed_at":"2026-08-01T17:35:37.149410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07997/citation-record","integrity":"/paper/2507.07997/integrity","json":"/paper/2507.07997/citation-record.json","paper":"/paper/2507.07997"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-06T18:32:54.656073Z","title":"Cosmos world foundation model platform for physical ai.arXiv preprint arXiv:2501.03575,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.656073Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:792460d2377f1b46d5257d953b5122031aa875168fb5664ffcc67b9af5ce171c","observation_id":"fa25afe9-7edb-429d-bea0-1266cf94a24a","resolution":{"observed_at":"2026-08-06T18:32:54.656073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:59.388419Z","title":"Soft-to-hard vector quantization for end-to-end learn- ing compressible representations.NeurIPS, 30, 2017","venue":null,"work_id":"686eb123-2790-47fc-9d6a-c52f5b682004","year":2017},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.660807Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:d594ae8378a6d99c1e3a439e5464c033accd95d2473c7d4c2487299dd817a7a8","observation_id":"5b7de03b-ad22-4b2b-84fd-e3ee19e7b33f","resolution":{"observed_at":"2026-08-06T18:32:59.443908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16681","last_updated":"2024-11-27T17:04:36Z","snapshot_observed_at":"2026-08-09T11:29:26.795376Z","submitted_at":"2024-11-25T18:59:53Z","title":"Factorized Visual Tokenization and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16681","snapshot_observed_at":"2026-08-06T18:32:54.664956Z","title":"Factorized visual to- kenization and generation.arXiv preprint arXiv:2411.16681,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.664956Z"},"links":{"cited_paper":"/paper/2411.16681","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:8f6576c3ece5a8ce3d78c058277d941b8e54370315d7bd35c55a95e8fc9f8365","observation_id":"1db8c4ea-d040-4ad5-b68b-0601ba76c886","resolution":{"observed_at":"2026-08-06T18:32:54.664956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-06T18:32:54.669038Z","title":"Es- timating or propagating gradients through stochastic neurons for conditional computation.arXiv preprint arXiv:1308.3432,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.669038Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:6337536fbdccc88addf33240856c3c542a83e0e944592ab940ae0e766270ab33","observation_id":"73144590-faef-4b83-b582-dbee1ea9afa8","resolution":{"observed_at":"2026-08-06T18:32:54.669038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:59.263241Z","title":"Matryoshka multimodal models","venue":null,"work_id":"b8f67e94-0186-4951-8496-7ef59545cb6a","year":2024},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.673680Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:e836b385e6fc3230a65ff5f09034874b0ce6f5d192331fd7860742ac07424a28","observation_id":"ab12f06f-5158-48ec-a2a1-c0bcf23d67e2","resolution":{"observed_at":"2026-08-06T18:32:59.328799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10733","last_updated":"2025-05-18T21:17:22Z","snapshot_observed_at":"2026-08-08T21:24:29.917572Z","submitted_at":"2024-10-14T17:15:07Z","title":"Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10733","snapshot_observed_at":"2026-08-06T18:32:54.677511Z","title":"Deep com- pression autoencoder for efficient high-resolution diffusion models.arXiv preprint arXiv:2410.10733, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.677511Z"},"links":{"cited_paper":"/paper/2410.10733","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:6c9935cf6394797ef82c19280867c140c250db37641ed6ecd053aedac9002d9a","observation_id":"60620f36-263c-4d3e-951e-ba897c60f8f8","resolution":{"observed_at":"2026-08-06T18:32:54.677511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01199","last_updated":"2024-09-09T13:49:53Z","snapshot_observed_at":"2026-08-08T23:08:42.315906Z","submitted_at":"2024-09-02T12:20:42Z","title":"OD-VAE: An Omni-dimensional Video Compressor for Improving Latent Video Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01199","snapshot_observed_at":"2026-08-06T18:32:54.681958Z","title":"Od- vae: An omni-dimensional video compressor for improving la- tent video diffusion model.arXiv preprint arXiv:2409.01199,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.681958Z"},"links":{"cited_paper":"/paper/2409.01199","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:5f29088db8c059f7d2f6e50c93b004e64119734f1c65851e8cfb0ce5ec1ca439","observation_id":"13f3989c-7f60-4ab6-ad48-f535f1370eac","resolution":{"observed_at":"2026-08-06T18:32:54.681958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15807","last_updated":"2023-09-27T17:30:19Z","snapshot_observed_at":"2026-08-02T11:54:13.342379Z","submitted_at":"2023-09-27T17:30:19Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15807","snapshot_observed_at":"2026-08-06T18:32:54.685858Z","title":"Emu: Enhancing image generation models using photogenic needles in a haystack","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.685858Z"},"links":{"cited_paper":"/paper/2309.15807","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:b82927f7e0bfca08a5fa35bb4e7d05a90df010dad594a16657d8c35e468ab616","observation_id":"ad80db0c-8681-4203-a2f1-25d1571e2008","resolution":{"observed_at":"2026-08-06T18:32:54.685858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:59.106929Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"d9e75378-1915-4458-9f3c-0aa878c21fb0","year":2009},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.690564Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:0c99f05893f707b1a3e89ae0b74a2087497e4387a01610205413d68d5c1a426e","observation_id":"0853d326-2f4d-46cb-be17-f8307673a8f8","resolution":{"observed_at":"2026-08-06T18:32:59.208196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:58.763113Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"c4d50e38-5a41-48cd-b3f5-e2066e097bbd","year":2021},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.694469Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:16ef16e255404a5dc05f766b829f12ba59cb11ccf18a36ca8a88c30ac9abf4da","observation_id":"2fe171f0-ce4b-46ce-b09c-176e1b3af673","resolution":{"observed_at":"2026-08-06T18:32:58.960457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:54.698515Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.698515Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:d9565f4d744b0e8131d5de0a8f2b40bbb6804539c933c8cb341bbe6375bccb7e","observation_id":"c20128ec-3ad6-4173-9dda-f5995c92a6ca","resolution":{"observed_at":"2026-08-06T18:32:54.698515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.12595","last_updated":"2022-07-04T16:11:08Z","snapshot_observed_at":"2026-08-08T00:07:52.551574Z","submitted_at":"2020-08-28T11:49:33Z","title":"Dynamical Variational Autoencoders: A Comprehensive Review","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.12595","snapshot_observed_at":"2026-08-06T18:32:54.702241Z","title":"Dynamical variational autoencoders: A comprehensive review.arXiv preprint arXiv:2008.12595, 2020","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.702241Z"},"links":{"cited_paper":"/paper/2008.12595","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:5eaf05c4f776c8d80151dbdf7c30b6209c4cbbdc6df6baa653798e9b6b6b48c6","observation_id":"315bc44b-6ed5-477e-a8ff-d4bcc06c5242","resolution":{"observed_at":"2026-08-06T18:32:54.702241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:58.158018Z","title":"Vector quantization.IEEE Assp Magazine, 1 (2):4–29, 1984","venue":null,"work_id":"d7f61526-7082-48a0-b11a-0bf11e6efa85","year":1984},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.705855Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:58a7f7b9bf6ab750bcb3e8a9ed93b198820e83ed326969bee7ceefa250499aa5","observation_id":"714d8be0-2def-43b2-829d-a69759ee7259","resolution":{"observed_at":"2026-08-06T18:32:58.461691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10429","last_updated":"2024-10-14T12:24:32Z","snapshot_observed_at":"2026-08-07T21:31:53.134914Z","submitted_at":"2024-10-14T12:24:32Z","title":"DOME: Taming Diffusion Model into High-Fidelity Controllable Occupancy World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10429","snapshot_observed_at":"2026-08-06T18:32:54.709837Z","title":"Dome: Tam- ing diffusion model into high-fidelity controllable occupancy world model.arXiv preprint arXiv:2410.10429, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.709837Z"},"links":{"cited_paper":"/paper/2410.10429","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:a0ff38991964e684236dc19c11b84e50fde027e70c63129a7f123a92a7e5550e","observation_id":"e7e61a31-cdb8-44f3-9958-9a1053b31b4c","resolution":{"observed_at":"2026-08-06T18:32:54.709837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09755","last_updated":"2025-01-16T18:59:04Z","snapshot_observed_at":"2026-08-07T11:44:23.055396Z","submitted_at":"2025-01-16T18:59:04Z","title":"Learnings from Scaling Visual Tokenizers for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09755","snapshot_observed_at":"2026-08-06T18:32:54.714314Z","title":"Learnings from scaling visual tokenizers for reconstruction and generation.arXiv preprint arXiv:2501.09755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.714314Z"},"links":{"cited_paper":"/paper/2501.09755","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:7c8788d5a36ccc62c67aa27caf046a92e54e1e424b7ffea2df9fcbad8d66acc5","observation_id":"09dadb60-9087-4483-9174-0060d7155eec","resolution":{"observed_at":"2026-08-06T18:32:54.714314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19505","last_updated":"2024-12-30T09:08:12Z","snapshot_observed_at":"2026-08-08T07:18:46.889539Z","submitted_at":"2024-12-27T07:44:07Z","title":"DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19505","snapshot_observed_at":"2026-08-06T18:32:54.718781Z","title":"Driving- world: Constructingworld model for autonomous driving via video gpt.arXiv preprint arXiv:2412.19505, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.718781Z"},"links":{"cited_paper":"/paper/2412.19505","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:31e3cdecc31d51daf9214dc5072164e1d1bc1cd28c1c965faa9ce5d7bea299a9","observation_id":"b2409850-6265-41af-87aa-044ac4955e59","resolution":{"observed_at":"2026-08-06T18:32:54.718781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:57.733228Z","title":"Image-to-image translation with conditional adversarial net- works","venue":null,"work_id":"5f75d770-2b21-49fc-b786-eeece1ac41de","year":2017},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.722500Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:cfabd7ac1b7799adb48772f897452d4cd6df6e610635cfe3a56b25abe1d84942","observation_id":"0cd1d0cf-b270-4830-9e69-42eba91510b7","resolution":{"observed_at":"2026-08-06T18:32:57.890039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:57.542136Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":"afeba96b-dac6-4201-8d6e-ae93c27360c1","year":2019},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.725903Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:58387a007bda44594f035c4700a0a231312f304d0f6d22a2f66410608ac54117","observation_id":"f9c740e7-39c0-402e-aaf7-f78ff48e811b","resolution":{"observed_at":"2026-08-06T18:32:57.609403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:57.415522Z","title":"Auto-encoding variational bayes, 2013","venue":null,"work_id":"2efcd78c-df52-4837-9f43-8599b875fe49","year":2013},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.729894Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:ce8dc6141f2b8cb34343462c3a4a97a236be9052acac246d06eeec6ecfc03ae9","observation_id":"5ea2efee-035c-49b7-9d10-f9c4a91f1059","resolution":{"observed_at":"2026-08-06T18:32:57.480027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:57.245530Z","title":"An introduction to variational autoencoders.Foundations and Trends® in Machine Learning, 12(4):307–392, 2019","venue":null,"work_id":"cc79c669-627c-4058-b5b5-51897ba1edec","year":2019},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.734039Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:d35427c3e281929128c5f8bf1a5e8296202306316b881ede398ef9f6b6eae507","observation_id":"712101f3-ed72-41ae-b32a-7cea93161efd","resolution":{"observed_at":"2026-08-06T18:32:57.301948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:57.043859Z","title":"Segment any- thing","venue":null,"work_id":"ab5349e8-0d81-45bb-9da7-2eaff57686a8","year":2023},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.737315Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:061de55eb39bff20cf9133e9804dc71e448dfbd287b8db1ba28d56a3e74e27d9","observation_id":"2dd59af8-2886-428e-aca6-dcc8275690c2","resolution":{"observed_at":"2026-08-06T18:32:57.125356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:56.882684Z","title":"Matryoshka representation learning.NeurIPS, 35: 30233–30249, 2022","venue":null,"work_id":"a4a7d3ea-9152-4ab0-bcaa-52d50bfa6bd2","year":2022},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.740846Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:8f38cb70d0812dcf5dda67723542109463dcc24abbc81075a5e175e3e4760790","observation_id":"19961738-1c1f-45e5-9d4e-de689cdf467a","resolution":{"observed_at":"2026-08-06T18:32:56.927856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:56.737490Z","title":null,"venue":null,"work_id":"790c82fa-3d6c-4c8c-9821-208da0186821","year":1956},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.745046Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:29487e6a381378b53b535dbf436847fecf3f51f9e7cc9e81083448f6d0d64e21","observation_id":"9ec191dc-30e3-4ba6-8aa4-6aaf25833d39","resolution":{"observed_at":"2026-08-06T18:32:56.808049Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:56.554756Z","title":"Fast and accurate image super-resolution with deep laplacian pyramid networks.PAMI, 41(11):2599–2613,","venue":null,"work_id":"5e9b0158-1036-426c-b15d-794ee9a4234d","year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.748505Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:603030a2ce1c3634953c91cb01f23403410328e12d5b8977fb06a7117491ebdc","observation_id":"32561895-2f25-4185-9655-7f12963d76ad","resolution":{"observed_at":"2026-08-06T18:32:56.646310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:56.390922Z","title":"Autoregressive image generation using resid- ual quantization","venue":null,"work_id":"cedddeb3-3a1e-41a7-be5c-1f8e07bd81b8","year":2022},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.751988Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:0daf23daa32c161d03741154bca913f91481959b0f0b370d8901f638235148a8","observation_id":"316f5cee-0dbc-474a-97ad-46deae0cb0e4","resolution":{"observed_at":"2026-08-06T18:32:56.476819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09067","last_updated":"2022-03-17T03:53:11Z","snapshot_observed_at":"2026-08-07T22:52:49.739121Z","submitted_at":"2022-03-17T03:53:11Z","title":"UNIMO-2: End-to-End Unified Vision-Language Grounded Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09067","snapshot_observed_at":"2026-08-06T18:32:54.755656Z","title":"Unimo-2: End-to- end unified vision-language grounded learning.arXiv preprint arXiv:2203.09067, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.755656Z"},"links":{"cited_paper":"/paper/2203.09067","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:7ab67324adc6ffaad299e17c3fa5bd4b0fd59013d759f9f1db0673029c6705d7","observation_id":"7b2b4650-5df9-4f6d-9f0b-f383f0ea5116","resolution":{"observed_at":"2026-08-06T18:32:54.755656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:54.759630Z","title":"Efficient neural radiance fields for interactive free-viewpoint video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.759630Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:568c91f12599f8761ab58ecdd77cf8c01c854d2e2f57faabe2fa49846d0304a9","observation_id":"ff678a4e-6db6-4a6c-b363-e2ab9266e367","resolution":{"observed_at":"2026-08-06T18:32:54.759630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05438","last_updated":"2021-06-10T00:23:33Z","snapshot_observed_at":"2026-07-06T11:17:47.803564Z","submitted_at":"2021-06-10T00:23:33Z","title":"Cross-Modal Discrete Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05438","snapshot_observed_at":"2026-08-06T18:32:54.763435Z","title":"Cross- modal discrete representation learning.arXiv preprint arXiv:2106.05438, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.763435Z"},"links":{"cited_paper":"/paper/2106.05438","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:e4862fecb94a8a6f2648226647c12b867e92065435c9c6dcf355b971404dc31f","observation_id":"ba18f4d1-3c5f-4941-b526-26759292792e","resolution":{"observed_at":"2026-08-06T18:32:54.763435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:56.205154Z","title":null,"venue":null,"work_id":"150cb642-df1a-4c48-8176-f7b2b27cba4d","year":2020},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.767670Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:77d6617b52162f9b3b319f0713c40a7dce332d36f557a681e9b6c24ab5f1bf09","observation_id":"321fcf6e-1492-40df-8db0-df32a3211422","resolution":{"observed_at":"2026-08-06T18:32:56.305892Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:56.015350Z","title":"Deep learning face attributes in the wild","venue":null,"work_id":"3f6a96df-4ce8-4298-b210-84c085baf19c","year":2015},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.771152Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:1d16fc9137836b28605e59000e5c2885b53cecfd95899d7bac97e1835ca02b82","observation_id":"72b9924d-a73a-4392-a3ce-4618461792b4","resolution":{"observed_at":"2026-08-06T18:32:56.099536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T18:32:54.774843Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.774843Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:e106ed5ab8a29e92399754d2e2f2428ad5916e2965c59b6202b936d009e3df9f","observation_id":"647f1e06-3d2c-4b8f-a764-65e6e8fdb115","resolution":{"observed_at":"2026-08-06T18:32:54.774843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-06T03:43:29.067278Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-06T18:32:54.777950Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual generation.arXiv preprint arXiv:2409.04410, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.777950Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:f74196462b32a333665ec418a7f2d6cc69af1d4e86fa84628df51ce7e4b05ea1","observation_id":"347ad2ab-9c45-40af-8a5f-7dd349dc16bc","resolution":{"observed_at":"2026-08-06T18:32:54.777950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.914010Z","title":"Uavid: A semantic segmentation dataset for uav imagery.ISPRS journal of photogrammetry and remote sensing, 165:108–119, 2020","venue":null,"work_id":"96d1671e-8c4c-4edd-b238-10371d116131","year":2020},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.782317Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:b85600df2699eb72bc8406a9752cd2fd6b6379fcf4471c98688592d17679009d","observation_id":"ab303b49-c4e5-4430-a397-1d2fc7294130","resolution":{"observed_at":"2026-08-06T18:32:55.941806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:54.785868Z","title":"Unitok: A unified tokenizer for visual generation and understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.785868Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:7b349107e60809f1ef4348c714a393bd4a4f89d4fe2f0a305ed579beb0577375","observation_id":"97bf4447-1ff3-4ff4-ae8c-00041e1622a6","resolution":{"observed_at":"2026-08-06T18:32:54.785868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.10493","last_updated":"2022-04-02T01:51:00Z","snapshot_observed_at":"2026-08-01T16:09:20.588590Z","submitted_at":"2021-11-20T01:49:56Z","title":"Discrete Representations Strengthen Vision Transformer Robustness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.10493","snapshot_observed_at":"2026-08-06T18:32:54.789146Z","title":"Discrete representations strengthen vision transformer robustness.arXiv preprint arXiv:2111.10493, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.789146Z"},"links":{"cited_paper":"/paper/2111.10493","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:9fe465774453d07962ba3a228437f9459fcea7b0cfb9338db7224013d44b0f10","observation_id":"ed12b8b9-3f68-430a-bc32-cfeb824a45de","resolution":{"observed_at":"2026-08-06T18:32:54.789146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.877198Z","title":"Spring: A high-resolution high- detail dataset and benchmark for scene flow, optical flow and stereo","venue":null,"work_id":"3f9b923c-c4dc-4359-a59a-ae7333243523","year":2023},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.792581Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:29d4c4fdf35fcb83c7e59196427e72e565895e9f1472508c030d25fd69b0705c","observation_id":"64b59686-6c1c-448a-ba6f-c15b1167db52","resolution":{"observed_at":"2026-08-06T18:32:55.898329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-06T18:32:54.796784Z","title":"Finite scalar quantization: Vq-vae made simple.arXiv preprint arXiv:2309.15505, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.796784Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:0b8b9d2b3be4dcde121ac5b6b7ce302c76c44d5b2ae41e005fd7ed2e69a58e42","observation_id":"c95d37b3-2ce2-47c8-aaff-35cb4c325d29","resolution":{"observed_at":"2026-08-06T18:32:54.796784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.842998Z","title":"The mapillary vistas dataset for semantic understanding of street scenes","venue":null,"work_id":"46b823b2-89a1-4e1d-ab9a-de2cdfbde0c9","year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.800707Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:53838492d5e1777137afcf97279da349254c4738f60b2fc06769888755190f5a","observation_id":"b279fdcf-2ce6-4b99-9524-7cdf3d08bd4b","resolution":{"observed_at":"2026-08-06T18:32:55.856664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.819036Z","title":"A benchmark dataset and evaluation methodology for video object segmentation","venue":null,"work_id":"acd26b3d-de60-40da-aa3f-9fc998688585","year":2016},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.804031Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:b9eef1119eeadfdf35e2adc46413c0a66ca2e8187b788874f1235d94319fd317","observation_id":"70b7f29d-03c4-4a4b-a944-87732a6e207e","resolution":{"observed_at":"2026-08-06T18:32:55.828149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T18:32:54.807968Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.807968Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:ea9d8d89def2ee3c65775c993a0eb65fde2a4108b6497d632739128314359cfc","observation_id":"7577d47b-25be-48c2-a497-548f77383735","resolution":{"observed_at":"2026-08-06T18:32:54.807968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.791916Z","title":"Generat- ing diverse high-fidelity images with vq-vae-2.NeurIPS, 32,","venue":null,"work_id":"db0259c3-a9a9-4ce3-9e94-944f3235d4e4","year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.811754Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:41d71b4f02b8df0d970aedf6411aaadb24648fea5b93b7f6c7a7a49d5984e925","observation_id":"c88a31c9-75f5-4cec-b0c6-e5e6160df8fe","resolution":{"observed_at":"2026-08-06T18:32:55.803913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.767151Z","title":"Learning ordered representations with nested dropout","venue":null,"work_id":"465f6b12-e691-461c-8b81-bf2eb52eecf5","year":2014},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.815370Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:169134a7d079a1c0302cce971ae745592d878055f263467463878a01e228158c","observation_id":"6ce2731a-ee8f-41b6-8911-4198a98b8c59","resolution":{"observed_at":"2026-08-06T18:32:55.776776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.741296Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"2146f01b-07cd-4258-b0b5-97137ce3ba4f","year":2022},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.819227Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:0458870adb16a32d3986fe5d54bbcf939f4319d21a98303f29963c50d9ad141a","observation_id":"ca12fda3-c56f-40d9-9efa-7ca4c4c2721f","resolution":{"observed_at":"2026-08-06T18:32:55.751750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.717686Z","title":"Laion-5b: An open large-scale dataset for training next gener- ation image-text models.NeurIPS, 35:25278–25294, 2022","venue":null,"work_id":"94438448-f718-4034-b943-43acc47358d9","year":2022},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.822684Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:52c8977567bc3ab8272eaf48f35801158fac36ddc5d5d702acf7851d3c14a509","observation_id":"06ec731d-8a51-4ebd-ad68-1c92be8d4a7b","resolution":{"observed_at":"2026-08-06T18:32:55.727962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.686901Z","title":"Textocr: Towards large- scale end-to-end reasoning for arbitrary-shaped scene text","venue":null,"work_id":"7e3e0ef8-59b9-4c83-b564-9823e73c2267","year":2021},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.826198Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:93373189b2ec05d5bbbcbd37977e45477dbc9ae3c66bdca35e61a7f31443c012","observation_id":"27a94147-c20e-44b9-932b-174afb033e8b","resolution":{"observed_at":"2026-08-06T18:32:55.700458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-06T18:32:54.829422Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.829422Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:b1b4657d46cd8f044ce9156f1781729ba379256472cb709581e3e1dddcae823b","observation_id":"28cfce01-97c4-4b8a-8837-c762e5680455","resolution":{"observed_at":"2026-08-06T18:32:54.829422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.07547","last_updated":"2022-06-09T12:46:05Z","snapshot_observed_at":"2026-07-06T13:10:16.795009Z","submitted_at":"2022-05-16T09:49:37Z","title":"SQ-VAE: Variational Bayes on Discrete Representation with Self-annealed Stochastic Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.07547","snapshot_observed_at":"2026-08-06T18:32:54.833870Z","title":"Sq-vae: Variational bayes on discrete representation with self-annealed stochastic quantization.arXiv preprint arXiv:2205.07547, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.833870Z"},"links":{"cited_paper":"/paper/2205.07547","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:1eab9265551f64855e91106366decda1c4d1501b337793ca3919ffab74a23b5a","observation_id":"40a081a7-63f0-4cb5-8680-99722b6c2972","resolution":{"observed_at":"2026-08-06T18:32:54.833870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:54.837875Z","title":"Visual autoregressive modeling: Scalable image gen- eration via next-scale prediction.NeurIPS, 37:84839–84865,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.837875Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:297849628521f92e9d726ade2afbd10946869d5fecd01b318f07f8d537c8321e","observation_id":"9a9cddf8-38a7-49d4-879d-6c3057efc929","resolution":{"observed_at":"2026-08-06T18:32:54.837875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.660351Z","title":"Neural discrete representation learning.NeurIPS, 30, 2017","venue":null,"work_id":"21cf6fea-6b85-4ccd-8cb9-fd72796490ee","year":2017},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.841691Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:8e5e2140a14df3623f2c4a0df634961cfa2147958336c00faaae21db31825f36","observation_id":"4f8bda5d-705c-4e97-a293-282fcb0252d7","resolution":{"observed_at":"2026-08-06T18:32:55.666141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.643824Z","title":"Neural discrete representation learning.NeurIPS, 30, 2017","venue":null,"work_id":"9621b2cb-070c-4859-90b4-5a630b250145","year":2017},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.844866Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:efdf6274f4d88916e52036c580c50ffcb5dc2faafb23bc53cc91f69c1678a369","observation_id":"87156a6f-4d3f-4d15-8228-ab7bc6faf0bd","resolution":{"observed_at":"2026-08-06T18:32:55.649860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-06T18:32:54.848969Z","title":"Emu3: Next-token prediction is all you need.arXiv preprint arXiv:2409.18869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.848969Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:978b2fc9b5ef3f9f9dfd11f9e679419ff03c4c2bc919ab310bed7f7d2e2528f8","observation_id":"9f4df827-a6c2-4f73-ae71-269af5e4a0aa","resolution":{"observed_at":"2026-08-06T18:32:54.848969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.629830Z","title":"Hierarchical quantized autoen- coders.NeurIPS, 33:4524–4535, 2020","venue":null,"work_id":"515816d6-1086-445e-906f-a45360317d09","year":2020},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.852737Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:39e4c23bdf83e792f17760361cfdb791cc1733128b9cdb96b9fb85a9f7c68e0e","observation_id":"afde9047-e48c-4259-b06e-a2df617f554c","resolution":{"observed_at":"2026-08-06T18:32:55.635306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00493","last_updated":"2023-01-02T00:36:22Z","snapshot_observed_at":"2026-07-06T14:36:37.805357Z","submitted_at":"2023-01-02T00:36:22Z","title":"Argoverse 2: Next Generation Datasets for Self-Driving Perception and Forecasting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00493","snapshot_observed_at":"2026-08-06T18:32:54.855897Z","title":"Argoverse 2: Next generation datasets for self-driving perception and forecasting.arXiv preprint arXiv:2301.00493,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.855897Z"},"links":{"cited_paper":"/paper/2301.00493","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:37f1da3e59f9607613bed8aedd68f917f27cd574f02a000ebb53a90720be89b0","observation_id":"7c3cf0e3-1857-480f-bcf5-a3b6e53a1634","resolution":{"observed_at":"2026-08-06T18:32:54.855897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.614081Z","title":"Vfhq: A high-quality dataset and benchmark for video face super-resolution","venue":null,"work_id":"5fa1eb5a-3996-45c5-acdf-5c017b9d15c6","year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.860072Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:19c2f16cc129bc21de13c9671e8a3ee4b30a26ecaa8b28e71660612e614926d5","observation_id":"aa95dc1f-7246-4bbf-8cfa-369e5b8ff5ff","resolution":{"observed_at":"2026-08-06T18:32:55.620759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T18:32:54.863560Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.863560Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:bc3c9c951b5bd8ea84bc4f205e03cbd2a31c70b0c5941f9d26fcc2273de98c6f","observation_id":"c1f1d8ef-2e58-4930-a484-411149d45c7c","resolution":{"observed_at":"2026-08-06T18:32:54.863560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.598362Z","title":"Locally hierarchical auto-regressive modeling for image generation.NeurIPS, 35:16360–16372, 2022","venue":null,"work_id":"5b314490-2eaf-4030-bd97-db49b8893cd1","year":2022},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.869276Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:ed790292f4d347ddd0d979701ac8f9e6e2c26f4ba5e7d58fd1f5886fa45839f9","observation_id":"66b9ce63-49de-4252-b813-124bb11a5af3","resolution":{"observed_at":"2026-08-06T18:32:55.603667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-06T18:32:54.876303Z","title":"Vector-quantized image modeling with improved vqgan.arXiv preprint arXiv:2110.04627, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.876303Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:e0466c9b9b131f0322bbfbae80a277eb33052521b7cd85aa218d112d4f4dbc4f","observation_id":"eab746ae-7afe-4f7d-b606-10734b7b2069","resolution":{"observed_at":"2026-08-06T18:32:54.876303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-06T18:32:54.880493Z","title":"Language model beats diffusion–tokenizer is key to visual generation.arXiv preprint arXiv:2310.05737, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.880493Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:2e1cd20d7a0108708bca02c5b9de1237c60a519d748f4ed74267b90cd30c0537","observation_id":"1ff981d7-ad2d-42ce-ad33-c26c8cede6ef","resolution":{"observed_at":"2026-08-06T18:32:54.880493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.585000Z","title":"Towards efficient and scale-robust ultra- high-definition image demoir´eing","venue":null,"work_id":"906c15ea-1224-4f30-948c-0494bc8dcc99","year":2022},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.884092Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:cdda45fcea6e32108fe4ec0770cef82098b352d877c45fbb3105394979c20d3a","observation_id":"bf266951-c957-4104-b4b0-97c5c85a392a","resolution":{"observed_at":"2026-08-06T18:32:55.589930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.570229Z","title":"Towards high-resolution salient object detection","venue":null,"work_id":"d0922ae1-6e43-443f-8c43-6ffd4b7dc617","year":2019},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.888095Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:24e0162ebac2639149f18a3cd6778dd17c0496ec7e6b0d43199761bbea7debab","observation_id":"0db0ce1f-929a-48cd-880c-256d4cacfda7","resolution":{"observed_at":"2026-08-06T18:32:55.576020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.551189Z","title":"Regularized vector quantization for tokenized image synthesis","venue":null,"work_id":"e009f64f-78cc-4d33-8b8d-ec5a3ca16fde","year":2023},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.891292Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:e70fcb6ef0b74afe22c65247f7d05860b8b0926b715b193da41637a5ef8805d9","observation_id":"8bf75040-ee6a-49ed-8862-c2b5f3e60716","resolution":{"observed_at":"2026-08-06T18:32:55.558567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24113","last_updated":"2025-06-30T17:56:35Z","snapshot_observed_at":"2026-08-08T02:57:16.646869Z","submitted_at":"2025-06-30T17:56:35Z","title":"Epona: Autoregressive Diffusion World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24113","snapshot_observed_at":"2026-08-06T18:32:54.894607Z","title":"Epona: Autoregressive dif- fusion world model for autonomous driving.arXiv preprint arXiv:2506.24113, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.894607Z"},"links":{"cited_paper":"/paper/2506.24113","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:16272fa01ad2050f709ef7c880d2ea0fbf718edeb1f4efc503431408e26df056","observation_id":"82e6a31f-dead-4d43-86a6-b2abc9cee4a0","resolution":{"observed_at":"2026-08-06T18:32:54.894607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:54.898803Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.898803Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:e4a7596feb06f3a616197fbe2a6a32798b38e3fe4e9adbabf86c06bf845ed48a","observation_id":"855632f1-6695-4218-8881-46c01f201e12","resolution":{"observed_at":"2026-08-06T18:32:54.898803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.410562Z","title":"Cv-vae: A compatible video vae for latent generative video models","venue":null,"work_id":"36e9935c-3b2f-4db1-b527-c87ac22c8459","year":2025},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.902299Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:de64bbd57285546dea9971ff7ce7e64a3de79744e8a055692e1a3c62406836bb","observation_id":"e8fbd35c-11c8-4da4-b460-e2b025f7ddd7","resolution":{"observed_at":"2026-08-06T18:32:55.418337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.395173Z","title":"Online clustered code- book","venue":null,"work_id":"deb0d713-98e0-4e81-899d-0503c4e25396","year":2023},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.905936Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:920dc9821c824bab8ff0d9a9a135474c1d2a2940e99be9635c622909d91e5fe0","observation_id":"a92fa275-1fe5-4b84-a263-7b0c0fc36a67","resolution":{"observed_at":"2026-08-06T18:32:55.401129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:55.378426Z","title":"Movq: Modulating quantized vectors for high-fidelity image generation.NeurIPS, 35:23412–23425, 2022","venue":null,"work_id":"cd1bda08-130c-4c96-9e49-8f87652af1bb","year":2022},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.909403Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:6996217d1aa6be74ba66a62fd71ec011637c5f2d6fc15312a7527a43fd8a6bd5","observation_id":"c29cddbf-4fe0-4516-b321-610f054d3e54","resolution":{"observed_at":"2026-08-06T18:32:55.386177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-06T18:32:54.914113Z","title":"Open-sora: Democratizing efficient video production for all.arXiv preprint arXiv:2412.20404, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.914113Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:c83ef304ae4365b8e7096559a7b22088a5e042acf7d055335a806723015cd8b4","observation_id":"7f52d659-5b7f-457e-b2ad-958dc16b605f","resolution":{"observed_at":"2026-08-06T18:32:54.914113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:54.917657Z","title":"Address- ing representation collapse in vector quantized models with one linear layer.arXiv preprint arXiv:2411.02038, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:54.917657Z"},"links":{"citing_paper":"/paper/2507.07997"},"observation_digest":"sha256:6533b1453f93e36686fdc5d5aef8fe39fa60ca559490c807b515ef0448ee2354","observation_id":"4b2cd5b7-117a-40be-a8df-9ee90f0ca735","resolution":{"observed_at":"2026-08-06T18:32:54.917657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.07997","last_updated":"2025-07-14T09:33:58Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T08:02:17.898149Z","submitted_at":"2025-07-10T17:59:54Z","title":"MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 4 inbound Pith citation observations for arXiv:2507.07997."}