{"as_of":"2026-08-21T04:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:baed3ff7578ecb23fc3be8a0e994496b14984770c59a6450ffcc24f90abcfd79","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T05:45:53.814169Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.22148/citation-record","integrity":"/paper/2607.22148/integrity","json":"/paper/2607.22148/citation-record.json","paper":"/paper/2607.22148"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.08243","last_updated":"2023-04-13T17:59:37Z","snapshot_observed_at":"2026-08-16T16:01:20.302377Z","submitted_at":"2023-01-19T18:59:01Z","title":"Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08243","snapshot_observed_at":"2026-08-01T05:45:46.003853Z","title":"Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture.arXiv preprint arXiv:2301.08243, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:46.003853Z"},"links":{"cited_paper":"/paper/2301.08243","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:2dd0e645d7b35cae115c6b3c82c2f64f9b1962bf3c446a3b98720eff280a00fa","observation_id":"72bf257f-8ada-4bd7-83de-c3450fadfd7e","resolution":{"observed_at":"2026-08-01T05:45:46.003853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:46.098210Z","title":"Meissonic: Revitalizing masked generative transformers for efficient high-resolution text-to-image synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:46.098210Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:025980e0c14176a9692b79f06d83b109ee7fa61a4a1423d7b761b9747b4f88ab","observation_id":"50dc31ba-b440-4d7e-adc8-5b9357df8a85","resolution":{"observed_at":"2026-08-01T05:45:46.098210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:46.185120Z","title":"Qwen2.5-VL Technical Report, February 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:46.185120Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:666afb24d48a06858d88c1ca497b956c935307454f1d508b505aa18696f53a5a","observation_id":"796413fa-0048-41e3-847d-a31c82ebbf3f","resolution":{"observed_at":"2026-08-01T05:45:46.185120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:46.244497Z","title":"Gaussian Embeddings: How JEPAs Secretly Learn Your Data Density.arXiv preprint arXiv:2510.05949, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:46.244497Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:6bc55c0d022c2cfd704fbb31ab669d3d6c93e00cee31bbbaa2283eee3378da50","observation_id":"0e4c9435-011e-4e94-b0a6-7e7c17226330","resolution":{"observed_at":"2026-08-01T05:45:46.244497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:46.304232Z","title":"InfoNCE Induces Gaussian Distribution","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:46.304232Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:1834fb28687f939a08627eaacf1abf2157f994e525d5c675859d9b5d94a71db6","observation_id":"0043aba3-5082-40ab-8fa1-694909897593","resolution":{"observed_at":"2026-08-01T05:45:46.304232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:46.384301Z","title":"Megalith-10m","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:46.384301Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:69e8261cd73d07494e5007ee28dcd1c54e1b9d7007d56796e93ed2c9bb3e6c80","observation_id":"f49310f3-ee3d-46cd-b82d-60ce645c2029","resolution":{"observed_at":"2026-08-01T05:45:46.384301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:46.434866Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:46.434866Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:2b291d98a08b4b2dea1d38a554de1b5b5bd3c4519584efe7c9c1679cbacaf0e8","observation_id":"833fbfd2-382a-4031-86bd-449d8006b886","resolution":{"observed_at":"2026-08-01T05:45:46.434866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:46.502007Z","title":"Freeman, Michael Rubinstein, Yuanzhen Li, and Dilip Krishnan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:46.502007Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:dfb4644577c24a48f28f3f48940ff4de8cfe1f3ed39f211b7962db02d95a55da","observation_id":"f31fe43a-4116-4c5a-8763-1cb98aa7af07","resolution":{"observed_at":"2026-08-01T05:45:46.502007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-08-16T09:34:56.272667Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-01T05:45:46.590317Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset.arXiv preprint arXiv:2505.09568, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:46.590317Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:11611c7dc95b3aeba764f51befc0e4feeb0ec30f4b59113dafa9a1878b24db1a","observation_id":"ac1779dd-68d1-4959-ad23-7d1213d66793","resolution":{"observed_at":"2026-08-01T05:45:46.590317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:46.665920Z","title":"Scaling instruction-finetuned language models.J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:46.665920Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:9adb53f9e091838ead0e6aa5c0389a0e6c9bb9ee55e7c7f1d6b7fe7cc0b8ce6b","observation_id":"e49b6bf8-ac3d-45c7-bcc0-0e194de79b4e","resolution":{"observed_at":"2026-08-01T05:45:46.665920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:46.764197Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:46.764197Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:3ec12f2033dbceba5f17c5e6a8efbad45edfa1cd6fe148beee7cb87530fa0d00","observation_id":"efbe321c-397f-4e6c-be9c-6df2d563946b","resolution":{"observed_at":"2026-08-01T05:45:46.764197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:46.846813Z","title":"Kelix Technical Report.arXiv preprint arXiv:2602.09843, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:46.846813Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:05f5dba51ed89a0e2af830e2a519692aa35003aaded43e26828baec08828870d","observation_id":"f2d2cc71-ff75-45a1-9612-bd29748382d8","resolution":{"observed_at":"2026-08-01T05:45:46.846813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:46.909203Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:46.909203Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:7c926e98b444da13686cc7b735f2c038c4b782c1128f27dcfd727baddcf9ee5b","observation_id":"54c027b1-8c87-49b0-9555-d3d62d050a9c","resolution":{"observed_at":"2026-08-01T05:45:46.909203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:47.005245Z","title":"Vqrae: Representation quantization autoencoders for multimodal understanding, generation and reconstruction.arXiv preprint arXiv:2511.23386, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:47.005245Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:b95b52ab9a9c7300f86927be2b866d50506bd74c833e636b508264fe66297800","observation_id":"06e34fe6-c61f-4a9f-94db-bfec986598dc","resolution":{"observed_at":"2026-08-01T05:45:47.005245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:47.088915Z","title":"Taming Transformers for High-Resolution Image Synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:47.088915Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:370d46a4cb8a463826faf407b5b20af1c35ece05b747300c58bff7c173ecd5a6","observation_id":"16bdff0f-202d-428a-8e5c-2bc2cb472ee2","resolution":{"observed_at":"2026-08-01T05:45:47.088915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-01T05:45:47.184952Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:47.184952Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:e94426e6ca641d7f2adab50827404822fea51ac268add2de9123675cc0251129","observation_id":"a4cee546-96fa-4534-8855-5789e29fc519","resolution":{"observed_at":"2026-08-01T05:45:47.184952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22058","last_updated":"2025-07-29T17:59:04Z","snapshot_observed_at":"2026-08-15T19:53:33.201174Z","submitted_at":"2025-07-29T17:59:04Z","title":"X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22058","snapshot_observed_at":"2026-08-01T05:45:47.269252Z","title":"X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again.arXiv preprint arXiv 2507.22058, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:47.269252Z"},"links":{"cited_paper":"/paper/2507.22058","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:168d444f8368a05480901f0465d95dd2b51ebfe8de60af3661982f88caf1c37a","observation_id":"a494cc63-de5d-4464-b164-b720c0c27936","resolution":{"observed_at":"2026-08-01T05:45:47.269252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:47.356835Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment.NeurIPS, 36:52132–52152, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:47.356835Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:d6badacc5c3eacf68e02036c0eb3826bc6566cd987fbc16937c1773e437b0a99","observation_id":"18ba2b33-1291-4f1a-8dbd-c3ce84df7847","resolution":{"observed_at":"2026-08-01T05:45:47.356835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18898","last_updated":"2025-06-23T17:59:14Z","snapshot_observed_at":"2026-08-15T23:43:47.561047Z","submitted_at":"2025-06-23T17:59:14Z","title":"Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18898","snapshot_observed_at":"2026-08-01T05:45:47.428321Z","title":"Vision as a dialect: Unifying visual understanding and generation via text-aligned representations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:47.428321Z"},"links":{"cited_paper":"/paper/2506.18898","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:04c270bae716ed0a0340370c63dc492b8b7e20ede069444911c8b719c123d940","observation_id":"06e61899-6925-4113-a9e1-dfd30d2ed4e2","resolution":{"observed_at":"2026-08-01T05:45:47.428321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:47.484865Z","title":"Girshick","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:47.484865Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:cdea8466507809db8ec5210931783c3e75a9ffddb5619e2788ef7bade6b55f52","observation_id":"a6c5d76e-25ce-44b0-a8c9-57dc59658ba0","resolution":{"observed_at":"2026-08-01T05:45:47.484865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:47.562345Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:47.562345Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:5157738421602ebbf6ba046a73dd71634f740f63231f2a62810f11d07da91826","observation_id":"4978c1df-8801-48ec-b477-8dda4bb9464d","resolution":{"observed_at":"2026-08-01T05:45:47.562345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-01T05:45:47.665498Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment.arXiv preprint arXiv:2403.05135, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:47.665498Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:3840dfcb9506c3cfd29147a67c9bf4136254eb11e836747d33511ec79721f7d8","observation_id":"9e46bccd-b596-474c-84da-07e9af7e48d0","resolution":{"observed_at":"2026-08-01T05:45:47.665498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:47.748604Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:47.748604Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:4816169419aa14d2bf588f11c924c94d9f9d36c2cd7cb1dbbe6e5f0a6596c3d1","observation_id":"8822651d-34ad-43cb-91bf-3700dfe0ad0a","resolution":{"observed_at":"2026-08-01T05:45:47.748604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:47.826727Z","title":"Kingma and Max Welling","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:47.826727Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:6b60011aa121ae50a8fd015a7ba073f93928eed5c73eff41d6c137e2dcb63119","observation_id":"a4f8965d-2c0a-4f5e-b6a1-7eaf93c7bce4","resolution":{"observed_at":"2026-08-01T05:45:47.826727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:47.900782Z","title":"Number 89","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:47.900782Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:4347342ba3b7e7bb48a016a6c3f62843a417c1b97a70e47f53ee8d9195fd2181","observation_id":"10a79e83-3b2a-443a-b4a1-62c47888a52c","resolution":{"observed_at":"2026-08-01T05:45:47.900782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:47.955745Z","title":"The double-ellipsoid geometry of CLIP","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:47.955745Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:eafe58441290881f44c6bfce3693e15094e7ae118063c7a062a410d10a50a38b","observation_id":"a6e22b5e-5577-4361-925f-f0503ad2b801","resolution":{"observed_at":"2026-08-01T05:45:47.955745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-01T05:45:48.037036Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:48.037036Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:49adad76d0f4e9e93953e398783abdb220f6fa5173d5967e6dcfbd9da082b8a4","observation_id":"9bbe2a9c-b775-4192-9c82-e8c1ac3768b3","resolution":{"observed_at":"2026-08-01T05:45:48.037036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-01T05:45:48.117869Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension.arXiv preprint arXiv:2307.16125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:48.117869Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:47811ec504fbc86981910a9b80589ab2d0816b2a777677e5af572259a39179e4","observation_id":"416902bd-e505-4350-9fcc-c440dc3ce7b6","resolution":{"observed_at":"2026-08-01T05:45:48.117869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-01T05:45:48.193559Z","title":"Evaluating object hallucination in large vision-language models.arXiv preprint arXiv:2305.10355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:48.193559Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:f88c517fc6e9484f020f717fee4a7e8066e89e27cd5d11c63688d9042945b8a5","observation_id":"d6153872-ae9d-4c1d-bfab-cb476ebd9668","resolution":{"observed_at":"2026-08-01T05:45:48.193559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05422","last_updated":"2025-08-15T08:56:27Z","snapshot_observed_at":"2026-08-19T10:58:29.505418Z","submitted_at":"2025-05-08T17:12:19Z","title":"TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05422","snapshot_observed_at":"2026-08-01T05:45:48.280451Z","title":"Toklip: Marry visual tokens to CLIP for multimodal comprehension and generation.CoRR, abs/2505.05422, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:48.280451Z"},"links":{"cited_paper":"/paper/2505.05422","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:44e64fcbafa0df7bfef18dc36077a94a315ae5be1a88fda4d20e2da86e45c66e","observation_id":"6527d101-63ed-4104-a6c3-74ef08f71b72","resolution":{"observed_at":"2026-08-01T05:45:48.280451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:48.352016Z","title":"Evaluating text-to-visual generation with image-to-text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:48.352016Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:2c0344c7c2948dc81a17ed5a308854217ba4fe547b6541e9ce8850feb9a6e067","observation_id":"973d2d08-cf59-4a2d-80ab-c8b27e4dd93d","resolution":{"observed_at":"2026-08-01T05:45:48.352016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:48.429054Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:48.429054Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:60958bb1382309fd952b33d25148c154aeb8a28d941bee69e00ad1ee945fbfd8","observation_id":"06265fe3-0fe8-4968-830f-714ea46666b7","resolution":{"observed_at":"2026-08-01T05:45:48.429054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:48.502285Z","title":"Mmbench: Is your multi-modal model an all-around player? In ECCV, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:48.502285Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:7dbfaf3294782751b0618522915f865ff79694f8702a00d0e6164716a05cc6ef","observation_id":"4fa85846-5d63-4d62-bb32-419f2e72508c","resolution":{"observed_at":"2026-08-01T05:45:48.502285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:48.568172Z","title":"Unitok: A unified tokenizer for visual generation and understanding.arXiv preprint arXiv:2502.20321, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:48.568172Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:9252885677e268e1a723ba5900f00b4635aff3e0175ccb3f6a9e9c43a5b03f75","observation_id":"206446c8-3406-4c48-9a0c-561452edaf95","resolution":{"observed_at":"2026-08-01T05:45:48.568172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:48.671160Z","title":"ReDDiT: Rehashing Noise for Discrete Visual Generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:48.671160Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:e562216912ba7ffde8211b552fb45d67e3cebfc345e63925da2bfa0b911f7900","observation_id":"61dff341-24f7-4cd9-b67d-efa5b20f370c","resolution":{"observed_at":"2026-08-01T05:45:48.671160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:48.706706Z","title":"Finite scalar quantization: VQ-V AE made simple","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:48.706706Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:096dba9a868aca483e5406c21827a9f8ad06fc2b34fcefe04e2b42706b41119d","observation_id":"bf5d329e-5fe9-49a9-9f8f-6e463610c50a","resolution":{"observed_at":"2026-08-01T05:45:48.706706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:48.722593Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:48.722593Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:3d251655ce417207d678314053114460b0e00e3650b56fbcc7b98cd491bb48d2","observation_id":"cd2d656b-f3e7-4beb-9c89-6443a21cad22","resolution":{"observed_at":"2026-08-01T05:45:48.722593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:48.802956Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:48.802956Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:2f9023e80fbf5428d4c067ce4a8ca80fcf886edbd823c0f326f1ed65ff42dde9","observation_id":"1a91faca-aa83-4134-83d6-299f862e5392","resolution":{"observed_at":"2026-08-01T05:45:48.802956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.18249","last_updated":"2026-06-17T18:39:52Z","snapshot_observed_at":"2026-07-06T23:53:45.117607Z","submitted_at":"2026-06-16T17:59:22Z","title":"Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.18249","snapshot_observed_at":"2026-08-01T05:45:48.872910Z","title":"Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification.arXiv preprint arXiv:2606.18249, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:48.872910Z"},"links":{"cited_paper":"/paper/2606.18249","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:431776c2c145fb8ba0ec3d79aabac885c558b5d120ee787249546c9060b20755","observation_id":"9c854ca6-81d8-4e93-bc08-8a569e233f91","resolution":{"observed_at":"2026-08-01T05:45:48.872910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:48.954296Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:48.954296Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:e00bb13f3aceeb755799461fcc0d0f60260ac234fd3dcfc1506dc102c03d72d1","observation_id":"624d129d-fe10-48d1-9af6-86fdb63e7242","resolution":{"observed_at":"2026-08-01T05:45:48.954296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:49.005103Z","title":"Qwen3.5: Towards native multimodal agents, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:49.005103Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:7a2bf69ffb8becfa07c21f6a6c860aac82f10c4ae0df990a091bc2565b93f92e","observation_id":"ae61d59f-7dfc-468b-b1c7-2b400dcfe70d","resolution":{"observed_at":"2026-08-01T05:45:49.005103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:49.091471Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:49.091471Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:0e7d51905fe31f4dab5bee54f6beacce9f0ad0243b4efe2a033be7c8a03025cf","observation_id":"c8035c2f-f1c1-42b5-bbbf-4fe8db41a06d","resolution":{"observed_at":"2026-08-01T05:45:49.091471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:49.248221Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:49.248221Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:fdc358a00982b4f98f133e6ec3fb1bca962d14c28bc262e53abe624f52c6afc3","observation_id":"b7a2f977-c871-4b10-955c-1a2c173bcb5e","resolution":{"observed_at":"2026-08-01T05:45:49.248221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:49.428876Z","title":"Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:49.428876Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:d51d8268855f287dbcf407936dd5fccc58642e7ad1e000981d1fea04ac8bb93d","observation_id":"2bd87e35-0886-4a72-9807-57685561b1db","resolution":{"observed_at":"2026-08-01T05:45:49.428876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:49.580438Z","title":"Improved techniques for training gans","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:49.580438Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:2dd8ff3f6294340fd3fab5a116ab950eb938963ca3500fb745af00d51a16322e","observation_id":"7c31d90d-a780-43de-99b6-178e0b93a205","resolution":{"observed_at":"2026-08-01T05:45:49.580438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02692","last_updated":"2025-03-10T09:01:48Z","snapshot_observed_at":"2026-08-19T22:28:10.405438Z","submitted_at":"2024-12-03T18:59:10Z","title":"Scalable Image Tokenization with Index Backpropagation Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02692","snapshot_observed_at":"2026-08-01T05:45:49.675083Z","title":"Scalable Image Tokenization with Index Backpropagation Quantization.arXiv preprint arXiv:2412.02692, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:49.675083Z"},"links":{"cited_paper":"/paper/2412.02692","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:13f28538eee3f65d96bac845b5a1f84c3edc5b515d724832510bad8494d0f0ad","observation_id":"8acbf257-b51b-49fe-903b-fffef47608a8","resolution":{"observed_at":"2026-08-01T05:45:49.675083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:49.766930Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:49.766930Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:983b07679fd576a92a48a688a254b1ce7ed0e8b499dda13add9782a3d7e8ae24","observation_id":"0843becb-7ab7-453e-ac05-cf9ec3de79f2","resolution":{"observed_at":"2026-08-01T05:45:49.766930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:49.849828Z","title":"What matters for Representation Alignment: Global Information or Spatial Structure?arXiv preprint arXiv:2512.10794, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:49.849828Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:b841123aef925e9fa750eebd016de0caa9f23203d64673b5424003771bf8ccb9","observation_id":"2b2f8818-4815-4f41-8fa1-a140d526f45c","resolution":{"observed_at":"2026-08-01T05:45:49.849828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18324","last_updated":"2026-05-18T12:42:34Z","snapshot_observed_at":"2026-08-20T04:08:02.089607Z","submitted_at":"2026-05-18T12:42:34Z","title":"Improved Baselines with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18324","snapshot_observed_at":"2026-08-01T05:45:50.035845Z","title":"Improved baselines with representation autoencoders.arXiv preprint arXiv:2605.18324, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:50.035845Z"},"links":{"cited_paper":"/paper/2605.18324","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:d8bdb886446e5895bbca53a56edef1f3358049b8db8c4613b0ed0f881a1f1f3f","observation_id":"4fdc2796-2052-4800-9ecf-466474d6a7de","resolution":{"observed_at":"2026-08-01T05:45:50.035845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-01T05:45:50.178943Z","title":"Autore- gressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:50.178943Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:20123a4a4ebd0ddb67e33a4eb9329239c3257fa6b3c59b63a20c144a27be0741","observation_id":"055139cb-474d-4159-a6f8-e7a304e38e7a","resolution":{"observed_at":"2026-08-01T05:45:50.178943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:50.436783Z","title":"Unilip: Adapting clip for unified multimodal understanding, generation and editing.arXiv preprint arXiv:2507.23278, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:50.436783Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:4c2ba3c342ed62f461c7e3a108c55c114d5cd49e3156f30c4095fc13d8ac38e2","observation_id":"1ffc50f7-e6f3-4d31-b563-22976b88a162","resolution":{"observed_at":"2026-08-01T05:45:50.436783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:50.532762Z","title":"LongCat-Next: Lexicalizing Modalities as Discrete Tokens.arXiv preprint arXiv:2603.27538, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:50.532762Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:83fb5e5a18a9665d2617aeaa8ccea0f32b77d0c89003925eb2897890f10958e8","observation_id":"7d2b9ce4-8b7f-4353-974c-ba298f9fb78a","resolution":{"observed_at":"2026-08-01T05:45:50.532762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:50.716716Z","title":"Zettlemoyer, Koustuv Sinha, Yann LeCun, and Saining Xie","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:50.716716Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:8116d6e5b37d9be07cf06ec719319a69889ed81341c045c70ef3e111ffd0aff8","observation_id":"74aa4b1d-7dc0-40d0-a02c-63246551198e","resolution":{"observed_at":"2026-08-01T05:45:50.716716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:50.912012Z","title":"Scaling text-to-image diffusion transformers with representation autoencoders.arXiv preprint arXiv:2601.16208, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:50.912012Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:2a6f61f90cc814df0004456bbc8214fb6f2e612e4d0370258d2d226f6723a9a7","observation_id":"959bfa66-56a0-49fc-9699-a8e2b1a939ce","resolution":{"observed_at":"2026-08-01T05:45:50.912012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-01T05:45:51.120447Z","title":"Gritsenko, Xiao Wang, Muhammad Ferjad Naeem, Ibrahim Alabdulmohsin, Nikhil Parthasarathy, Talfan Evans, Lucas Beyer, Ye Xia, Basil Mustafa, Olivier J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:51.120447Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:48224eaf1d9a5d8e2e7adecb52887370e8eee84770ab405a3ef3999c69e1b8f7","observation_id":"50979421-3fc0-4c14-820e-73ffec485bec","resolution":{"observed_at":"2026-08-01T05:45:51.120447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:51.295217Z","title":"Neural discrete representation learning.NeurIPS, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:51.295217Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:f06d840622aa672dbb733221c89ef14bc19819b766c858ee3ac6523f77ea3f87","observation_id":"3e3e6d1b-4557-4cdd-9117-307a03e711c2","resolution":{"observed_at":"2026-08-01T05:45:51.295217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:51.501713Z","title":"Cambridge Series in Statistical and Probabilistic Mathematics","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:51.501713Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:20505be39ec67b9f638648375f9af75e191acb926cf0c758c5739e162b11c661","observation_id":"0916a318-703c-4f3f-8dc3-f6e8462b0cac","resolution":{"observed_at":"2026-08-01T05:45:51.501713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:51.740715Z","title":"Understanding contrastive representation learning through alignment and uniformity on the hypersphere","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:51.740715Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:bd7436f18c47efe22691ea6c87a47d89b7f8442bd77092f1e27c5166bc6bc760","observation_id":"8d84ffb4-f14d-4a5d-a79d-9c8d2faf811f","resolution":{"observed_at":"2026-08-01T05:45:51.740715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.31604","snapshot_observed_at":"2026-08-01T05:45:51.915796Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models.arXiv preprint arXiv:2605.31604, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:51.915796Z"},"links":{"cited_paper":"/paper/2605.31604","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:81460c20e2bf2d16d7dbca7cf23599b721e0bd35ed7bb1a5616153540d0f6261","observation_id":"b199c5fd-609f-490d-93d7-a54484d3769d","resolution":{"observed_at":"2026-08-01T05:45:51.915796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-01T05:45:52.097638Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation.arXiv preprint arXiv:2410.13848, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:52.097638Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:a351c59afb87fac86a4d8fb0a498aad3009f33e060577396dc2061739275c298","observation_id":"1f314bad-e582-40f8-bd88-f01600fb1665","resolution":{"observed_at":"2026-08-01T05:45:52.097638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:52.271462Z","title":"VILA-U: a unified foundation model integrating visual understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:52.271462Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:f002051cef95af7312e86d309c63812533e5a8884886883d7d7532763eece7f1","observation_id":"bbc6055e-16cb-4698-b9ad-1aabde12399e","resolution":{"observed_at":"2026-08-01T05:45:52.271462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-08-18T17:34:44.890427Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-01T05:45:52.488229Z","title":"Show-o: One single transformer to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:52.488229Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:9d2f93a2e7ab9db06942f1c9f86031ed017672ebc3951f8f2c8f8bfadabd9fef","observation_id":"f4f295e0-5ea2-49db-91a5-ddbb2ff321ce","resolution":{"observed_at":"2026-08-01T05:45:52.488229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:52.733255Z","title":"Muse-vl: Modeling unified vlm through semantic discrete encoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:52.733255Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:902642bf2cd4024cdc4bd6ef58250cc89f83b4303acecbdc014b7d0194ce3240","observation_id":"650affc0-9c50-47dc-a183-40bcbc5c7248","resolution":{"observed_at":"2026-08-01T05:45:52.733255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:52.876744Z","title":"Towards scalable pre-training of visual tokenizers for generation.arXiv preprint arXiv:2512.13687, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:52.876744Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:af0714f6dbb9bf437f7a0a711c0a5a4dd7da5cf3756afc5258252eac89a96baa","observation_id":"3a9d651c-d54b-49a7-839d-088b2b1dafbd","resolution":{"observed_at":"2026-08-01T05:45:52.876744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:52.992939Z","title":"Reconstruction vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:52.992939Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:07dbc34df169f625f648fc8746453fc6859de68ea41de6c457ae4f40a51724b9","observation_id":"a30cc9d7-6bbb-4fc8-8133-f8f9d9e5fe7e","resolution":{"observed_at":"2026-08-01T05:45:52.992939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-01T05:45:53.082144Z","title":"Gundavarapu, Luca Versari, Kihyuk Sohn, David Minnen, Yong Cheng, Vighnesh Birodkar, Agrim Gupta, Xiuye Gu, Alexander G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:53.082144Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:21bd9db01b023b2c95397448ac736d4bfc73a68b50f2170028438d08ba8a230d","observation_id":"9870d400-c33e-4aa4-9102-eee85c43cac1","resolution":{"observed_at":"2026-08-01T05:45:53.082144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.03924","last_updated":"2018-04-10T19:25:07Z","snapshot_observed_at":"2026-08-14T19:55:52.339887Z","submitted_at":"2018-01-11T18:54:17Z","title":"The Unreasonable Effectiveness of Deep Features as a Perceptual Metric","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.03924","snapshot_observed_at":"2026-08-01T05:45:53.205403Z","title":"Efros, Eli Shechtman, and Oliver Wang","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:53.205403Z"},"links":{"cited_paper":"/paper/1801.03924","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:1a74fd7723a48260090dec4b846b2b22061d89db80a8ebff0235778681066dfb","observation_id":"28755041-d2aa-4a28-9139-f2e51da0852c","resolution":{"observed_at":"2026-08-01T05:45:53.205403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:53.328418Z","title":"Spherical leech quantization for visual tokenization and generation.CoRR, abs/2512.14697, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:53.328418Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:d66d046922cf33089e3571101c1adc849ae894fb3a46e19088d56c33d9d5dd38","observation_id":"23e1c1f7-242c-4a65-a72f-14f286ee88e0","resolution":{"observed_at":"2026-08-01T05:45:53.328418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-16T14:57:26.851711Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05178","snapshot_observed_at":"2026-08-01T05:45:53.491983Z","title":"Qlip: Text-aligned visual tokenization unifies auto-regressive multimodal understanding and generation.arXiv preprint arXiv:2502.05178, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:53.491983Z"},"links":{"cited_paper":"/paper/2502.05178","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:c533d5d79bac794c50f2c2366de38c4aab0f1c1ad08566e3acba65c5be70a38c","observation_id":"aff2e8d0-fbac-4880-9063-09d70c87d728","resolution":{"observed_at":"2026-08-01T05:45:53.491983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-08-13T23:51:28.874833Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-08-01T05:45:53.599400Z","title":"Diffusion transformers with representation autoencoders.CoRR, abs/2510.11690, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:53.599400Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:eb3565dfc1f73bfb3777bca81baa605904bdb479e7a5f8b2a0cf76c02050552a","observation_id":"9cc30e6e-7294-4a43-894b-a51e2c1c803f","resolution":{"observed_at":"2026-08-01T05:45:53.599400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:53.702281Z","title":"Addressing representation collapse in vector quantized models with one linear layer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:53.702281Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:3c49478c6815ca274a769943cad8a818753c0baf45504cb57aed6ebc1c16e569","observation_id":"af899a3b-41a7-40e3-b720-f5f85663ad0f","resolution":{"observed_at":"2026-08-01T05:45:53.702281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T05:45:53.814169Z","title":"Advancing aesthetic image generation via composition transfer.Int","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:53.814169Z"},"links":{"citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:1868b0366736ede934f0dfe864e642fa237c9d5e73816873d09c6ba5aec68001","observation_id":"ecfc4c53-f56b-409c-8ce3-f29c6a15559a","resolution":{"observed_at":"2026-08-01T05:45:53.814169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T14:26:51.007657Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":72,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2607.22148."}