{"as_of":"2026-08-14T16:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c3eea019ab04c7a6424935136ef466e8a3052f9c5e2ba7dd6c812f3d70106057","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:55:34.006981Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:39:35.498461Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T15:39:37.142903Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"cited_work":{"arxiv_id":"2411.10281","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.10281","snapshot_observed_at":"2026-08-07T15:39:37.142903Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","venue":"cs.CV","work_id":"9b53b44a-cb02-43b3-885a-7577e348c4c8","year":2024},"citing_paper":{"arxiv_id":"2505.14411","last_updated":"2026-06-01T12:05:07Z","snapshot_observed_at":"2026-08-14T02:52:13.273799Z","submitted_at":"2025-05-20T14:24:49Z","title":"Byte Pair Encoding for Efficient Time Series Forecasting","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:39:35.498461Z"},"links":{"cited_paper":"/paper/2411.10281","citing_paper":"/paper/2505.14411"},"observation_digest":"sha256:1ead0b5f60fc104213b7e9254b61f2d3e19449a04fbdaa7b1855be6b8079b81c","observation_id":"3a2a3020-747e-48b4-919a-6e1d3953e1cb","resolution":{"observed_at":"2026-08-07T15:39:37.205007Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.10281/citation-record","integrity":"/paper/2411.10281/integrity","json":"/paper/2411.10281/citation-record.json","paper":"/paper/2411.10281"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:35.174366Z","title":"Learning representations and generative models for 3D point clouds","venue":null,"work_id":"ee5c0684-583b-4986-ba16-325f12042b22","year":2018},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.657533Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:f80f0f13100b132e77e813e3d2823a0dbe7e9acf3bfb141fb55e9921fead6334","observation_id":"71bd8ef6-9bbf-4513-8a43-cf3ed1d379ff","resolution":{"observed_at":"2026-08-12T19:55:35.179702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:35.158341Z","title":"Efficient string matching: an aid to bibliographic search","venue":null,"work_id":"096fd432-ec86-4fce-9b16-a32b3fece69b","year":1975},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.663244Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:bfa1814bcff145366b638d703303be361ee52486fe9b6db02f3b1a42bb0c7908","observation_id":"253e513f-9596-4888-aa4b-7c0237a5792b","resolution":{"observed_at":"2026-08-12T19:55:35.163429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-08-12T12:07:33.202888Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-12T19:55:33.668666Z","title":"Neural machine translation by jointly learning to align and translate","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.668666Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:5acd2834896919ee5e8e5fcf9d9449dac38e78bad8562fdc4bbea1268f4b5ad2","observation_id":"783d00ba-6911-48a4-afd6-4c192596b9e8","resolution":{"observed_at":"2026-08-12T19:55:33.668666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:35.142283Z","title":"Neural machine translation by jointly learning to align and translate, 2016","venue":null,"work_id":"a8860450-14df-48cc-a8fa-3029bedd6fa1","year":2016},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.674478Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:0fc9ff124b8b251a24708650ac98ed2f8eb3f0340daaaf3cfcac3c4933038aa1","observation_id":"40980b4d-6b4a-414b-996f-e985b3ac5d96","resolution":{"observed_at":"2026-08-12T19:55:35.147512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:33.680124Z","title":"Mip-nerf: A multiscale representation for anti-aliasing neu- ral radiance fields","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.680124Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:894a36b21a22b4b6b3e77fdc9fa0f1624f6ae1492f57821719d6eaf31243363c","observation_id":"0ee76d48-3151-4f0d-bf25-bad94200c881","resolution":{"observed_at":"2026-08-12T19:55:33.680124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:35.116119Z","title":"Viewpoint textual inversion: Discovering scene representa- tions and 3d view control in 2d diffusion models, 2024","venue":null,"work_id":"08f33634-c627-447a-afb5-6dc175fcb1c0","year":2024},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.685484Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:763f7bb9093d9cec07e0fe296a0cda190b3de8bd51539628a7e12125f82f1aad","observation_id":"f21f1dff-1442-4833-8830-f6920bcb1008","resolution":{"observed_at":"2026-08-12T19:55:35.121568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:33.690818Z","title":"Efficient-vqgan: To- wards high-resolution image generation with efficient vision transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.690818Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:afe4bc59ffe78a9f6c5be4416feb8d0a520ed694a64317029fae8849365f2b25","observation_id":"ca78311c-f7ff-4ee3-859e-96fa3e5a5196","resolution":{"observed_at":"2026-08-12T19:55:33.690818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03012","last_updated":"2015-12-09T19:42:48Z","snapshot_observed_at":"2026-08-13T14:41:45.148742Z","submitted_at":"2015-12-09T19:42:48Z","title":"ShapeNet: An Information-Rich 3D Model Repository","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03012","snapshot_observed_at":"2026-08-12T19:55:33.696390Z","title":"Chang, Thomas A","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.696390Z"},"links":{"cited_paper":"/paper/1512.03012","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:ab276e3c79faa79db74e3dea3385ec521bcab012cf1861695448bef1aba02a3f","observation_id":"4179f228-2cc8-4584-9be5-b7941a8674a6","resolution":{"observed_at":"2026-08-12T19:55:33.696390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:35.088179Z","title":"PixelSNAIL: An improved autoregressive genera- tive model","venue":null,"work_id":"aae61d06-f3b4-4de6-9144-86fc9b884c42","year":2018},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.701631Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:7c7c3fd7694b26d6096ca28d1d3881b2b84e01efb1a1f9067bae8abd4f241032","observation_id":"5209b124-8fca-4dc8-8beb-e51da159b965","resolution":{"observed_at":"2026-08-12T19:55:35.093177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:35.071586Z","title":"Up- gpt: Universal diffusion model for person image generation, editing and pose transfer, 2023","venue":null,"work_id":"ae82927e-6369-42ba-ace0-8e545d5a777f","year":2023},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.706469Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:bf7ca35ba6b0dec1b374641dd4cf290d40362cdd8f758876163c0744366f9e52","observation_id":"8cdaac1f-e3b0-4ad3-b209-8f0f81174458","resolution":{"observed_at":"2026-08-12T19:55:35.076738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15807","last_updated":"2023-09-27T17:30:19Z","snapshot_observed_at":"2026-08-13T10:03:45.960823Z","submitted_at":"2023-09-27T17:30:19Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15807","snapshot_observed_at":"2026-08-12T19:55:33.712367Z","title":"Emu: Enhanc- ing image generation models using photogenic needles in a haystack","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.712367Z"},"links":{"cited_paper":"/paper/2309.15807","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:466fe76e01e6534a617ad12d614ea12eecce316e49fee11d8c7f5bf2c71f883c","observation_id":"f11adb39-86ff-422e-989a-83fe795b36cf","resolution":{"observed_at":"2026-08-12T19:55:33.712367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:35.055639Z","title":"The road less scheduled, 2024","venue":null,"work_id":"1f0ce619-eb8f-43c8-9fd3-e26079f5c01a","year":2024},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.718160Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:a39f7dfbc8052e891ed9b4cded1b871d671fac4444c5d3c3a45a965991e84971","observation_id":"e8cca950-98fc-4a7c-800c-070912aaa154","resolution":{"observed_at":"2026-08-12T19:55:35.060417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19223","last_updated":"2025-01-07T16:20:17Z","snapshot_observed_at":"2026-08-13T23:15:13.862539Z","submitted_at":"2024-06-27T14:49:08Z","title":"T-FREE: Subword Tokenizer-Free Generative LLMs via Sparse Representations for Memory-Efficient Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19223","snapshot_observed_at":"2026-08-12T19:55:33.723119Z","title":"T-free: Tokenizer- free generative llms via sparse representations for memory- efficient embeddings","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.723119Z"},"links":{"cited_paper":"/paper/2406.19223","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:f393656202d3026fdd7f5f629444beecf6de12bd3cbf53aad24c63cea53c71be","observation_id":"ab818560-e29d-4620-ab8d-64d878cb1a9d","resolution":{"observed_at":"2026-08-12T19:55:33.723119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:35.039483Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"e0f1870f-a7dd-4444-8ac3-b4667edbf481","year":2009},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.728437Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:57c17b4e4bd24162c0d268a5bb384206742426c06a5c9de60dc50f1463863c63","observation_id":"d33ac60a-e0c9-4fa8-83bb-286928a790ef","resolution":{"observed_at":"2026-08-12T19:55:35.044771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:35.023237Z","title":"The mnist database of handwritten digit images for machine learning research","venue":null,"work_id":"d93b2ef9-bcc4-448d-9d60-7b70bcf61aec","year":2012},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.733332Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:f34dc402e2bd42f5387232a6a663e290662635c0b3ec172294a33358a2aa846a","observation_id":"acfeaedb-e1c0-446a-bde8-497632c1d70b","resolution":{"observed_at":"2026-08-12T19:55:35.028391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T19:55:33.738109Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.738109Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:0de42db903985df796f85fc33a748523a5f4edc53391bbb136f30f54f6ad60a6","observation_id":"24e8d92d-7c77-4c62-923f-ba7d7aa763ae","resolution":{"observed_at":"2026-08-12T19:55:33.738109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T19:55:33.742966Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.742966Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:72c978438582be4d3db5a8cec12bfc34e147c5d71423a3ee064d84b78acdbea5","observation_id":"5c04605d-0c88-4d36-84f6-2f893496a985","resolution":{"observed_at":"2026-08-12T19:55:33.742966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11913","last_updated":"2024-08-05T17:50:03Z","snapshot_observed_at":"2026-08-13T22:39:55.831799Z","submitted_at":"2024-07-16T17:05:20Z","title":"Quantised Global Autoencoder: A Holistic Approach to Representing Visual Data","version":2},"cited_work":{"arxiv_id":"2407.11913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.11913","snapshot_observed_at":"2026-08-12T19:55:34.411849Z","title":"Quantised Global Autoencoder: A Holistic Approach to Representing Visual Data","venue":"cs.CV","work_id":"4aacd5de-87fb-439d-893d-afc2faa43391","year":2024},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.748476Z"},"links":{"cited_paper":"/paper/2407.11913","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:a4d1cb45cf6bfe3aa6c8722934ad65f750bb7d4ad0ad89ea39715c6a5609f0e1","observation_id":"aba82095-5abb-4069-b7ac-6fbd8c14d956","resolution":{"observed_at":"2026-08-12T19:55:34.417487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-10T11:20:37.820487Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-08-12T19:55:33.753757Z","title":"Tam- ing transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.753757Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:5c82ebae8253fa517bf733252c603995e5ab9e63b66fe738d0c5326f94c2cf6c","observation_id":"bbaa8e96-9bf4-4016-9746-e1790a49c5d4","resolution":{"observed_at":"2026-08-12T19:55:33.753757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:33.758960Z","title":"Ccedit: Creative and controllable video editing via diffu- sion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.758960Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:04283e830e80adf1debd248c6b29b8e000be726315d69fd335f4b99ec980961b","observation_id":"fe54418e-1977-433b-ab6c-3c4a1d7aa3ec","resolution":{"observed_at":"2026-08-12T19:55:33.758960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.997306Z","title":"Generative adversarial nets","venue":null,"work_id":"e6450400-2c09-476f-83ad-f2efe13e93d7","year":2014},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.763728Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:afa2e310cf8f9146c8a07fdc08ff39e3755738b95b9e2b44b53e1ea3099b3508","observation_id":"6ef0aeb2-e1a2-41cb-a529-ddca29d9a4d5","resolution":{"observed_at":"2026-08-12T19:55:35.002584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:33.768350Z","title":"Vec- tor quantized diffusion model for text-to-image synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.768350Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:4d0ba62d8d2c9f0e17729ee9a67c9dc84e060cadd12fb0476eff5654f8b3e33f","observation_id":"7d5a5619-821d-4d4c-9d74-76be55e020f8","resolution":{"observed_at":"2026-08-12T19:55:33.768350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08500","last_updated":"2018-01-12T14:05:44Z","snapshot_observed_at":"2026-08-14T14:27:27.066890Z","submitted_at":"2017-06-26T17:45:23Z","title":"GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08500","snapshot_observed_at":"2026-08-12T19:55:33.773183Z","title":"Gans trained by a two time-scale update rule converge to a nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.773183Z"},"links":{"cited_paper":"/paper/1706.08500","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:6383926b48847478e0f9e5fee27b4510d1230d919173d41ab8fe882ce3742440","observation_id":"a92fb3b9-183c-48f8-952a-4298d29af673","resolution":{"observed_at":"2026-08-12T19:55:33.773183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:33.778348Z","title":"Reducing the dimensionality of data with neural networks","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.778348Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:422305feb8c168364a7c54dee66c78410fe9e0448c11401398121046d637e8a4","observation_id":"05401cb2-a5c9-4639-946d-7caee4dd8388","resolution":{"observed_at":"2026-08-12T19:55:33.778348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:33.783157Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.783157Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:a30c399fb7dbb99c08a9e8b50f6d7317dd7e6f9fe3a19de485bfcda6046234d9","observation_id":"ccbd1951-64b9-4c72-a64a-2a249dacc64a","resolution":{"observed_at":"2026-08-12T19:55:33.783157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.950006Z","title":"Towards accurate image coding: Improved au- toregressive image generation with dynamic vector quantiza- tion (supplementary material)","venue":null,"work_id":"de2b601e-750b-4cec-a946-f86bbaee08e5","year":null},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.788379Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:0ae002d54d9505fa6ef0db34d19a6816dd2b7432e9b29a92bb8fa1680c671984","observation_id":"8b7f147b-f273-4348-882f-8001b2aafdcb","resolution":{"observed_at":"2026-08-12T19:55:34.955198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.933469Z","title":"Octree trans- former: Autoregressive 3d shape generation on hierarchi- cally structured sequences","venue":null,"work_id":"74f8d92f-505e-4344-bcce-355ac4d8bc70","year":2023},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.793752Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:13298766bfce91a3c9d532adf23b863e0a485e6937f1ce7814f26a151d57868d","observation_id":"93857b8c-7909-442b-88e3-a2195d5c4936","resolution":{"observed_at":"2026-08-12T19:55:34.938916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.15264","last_updated":"2022-07-21T14:03:13Z","snapshot_observed_at":"2026-07-06T12:13:34.860050Z","submitted_at":"2021-11-30T10:23:06Z","title":"EdiBERT, a generative model for image editing","version":3},"cited_work":{"arxiv_id":"2111.15264","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.15264","snapshot_observed_at":"2026-08-12T19:55:34.348745Z","title":"EdiBERT, a generative model for image editing","venue":"cs.CV","work_id":"f3c42bf2-1a26-48ed-8944-cc812f48dbdb","year":2021},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.798601Z"},"links":{"cited_paper":"/paper/2111.15264","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:677a0998b9a74dc19db4b25d105de83eb807a567404e79f0a3415039893409f4","observation_id":"5980840e-6b2a-48b8-8b4a-0b3734ec9044","resolution":{"observed_at":"2026-08-12T19:55:34.356205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.916246Z","title":"One-shot learning meets depth diffusion in multi-object videos, 2024","venue":null,"work_id":"0dc16577-e4a0-48d7-831b-2ef8a5dc4462","year":2024},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.803874Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:c3f04060d07f2d60c4c23281ba5a43da21a3ff825c29e1f1164c55eb55ef6786","observation_id":"3038f31e-b13f-4b86-8618-d67c6c189f42","resolution":{"observed_at":"2026-08-12T19:55:34.921960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-12T19:55:33.808687Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.808687Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:a474677301c9f439ffad724cda081ce9ee719039a4cd9388770055ecd3476ef5","observation_id":"1a1a51ac-deff-4809-abc0-7bb2b6a34e5d","resolution":{"observed_at":"2026-08-12T19:55:33.808687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12753","last_updated":"2024-07-17T17:22:43Z","snapshot_observed_at":"2026-08-12T23:20:10.521449Z","submitted_at":"2024-07-17T17:22:43Z","title":"LookupViT: Compressing visual information to a limited number of tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12753","snapshot_observed_at":"2026-08-12T19:55:33.813385Z","title":"Lookupvit: Compressing visual information to a limited number of tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.813385Z"},"links":{"cited_paper":"/paper/2407.12753","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:01a629488e5a8eb41699663a4d9e1fc05c66e345ad697944e95d863e4759b08e","observation_id":"9850c8fa-0b9b-4397-979b-66272112dca5","resolution":{"observed_at":"2026-08-12T19:55:33.813385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.900059Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":"27beb6d7-0d31-4326-b5e4-7dbe73573d82","year":2009},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.819442Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:48cc93ba55ed70b56f67bb2f5146c5d158d83d41263864d8b03adff66625be0c","observation_id":"cca7de3c-1624-4ab8-b57b-6e3920d0a0ef","resolution":{"observed_at":"2026-08-12T19:55:34.905256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.882303Z","title":"Sentencepiece: A sim- ple and language independent subword tokenizer and detok- enizer for neural text processing, 2018","venue":null,"work_id":"7dd1e21e-4fd7-4001-bc74-1a740004759e","year":2018},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.824274Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:3f5bba2906e5044109769b8bef85cdc861f843ca3d8fd7633bf11c6f66a9aef9","observation_id":"0c6b5f03-9c8d-488e-93b5-81205e7ccfb7","resolution":{"observed_at":"2026-08-12T19:55:34.888180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.864431Z","title":"Openassistant conversa- tions – democratizing large language model alignment, 2023","venue":null,"work_id":"9b38dfaf-5167-4480-9485-d2a765ad0ca2","year":2023},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.829200Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:0271de75134acc837a6f262b381036b4c5ded20d513afda0eedc00182c0589f3","observation_id":"1879d5af-0d75-45c0-8888-b6e6368d2e59","resolution":{"observed_at":"2026-08-12T19:55:34.870080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.847357Z","title":"Robust training of vector quantized bottleneck models","venue":null,"work_id":"2722f5ac-4f6e-42a1-8f89-3d22234bc9ad","year":2020},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.835021Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:7e9fdf3058b2b23cfb450065011f59668c010d776929c70d897609b43fbe3e68","observation_id":"b69f851c-fedf-471a-9f65-64a1522b2ec8","resolution":{"observed_at":"2026-08-12T19:55:34.852398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.830887Z","title":"Autoregressive image generation using residual quantization","venue":null,"work_id":"a941361d-5451-4da4-9bb7-94155c2d255e","year":2022},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.839778Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:59db8304b669c991a21ec63c13656e226266db2c19ece921f6c3f7c5cbe46311","observation_id":"efd74836-3b81-4d5c-ada8-e57013901c0f","resolution":{"observed_at":"2026-08-12T19:55:34.835955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-12T19:55:33.844918Z","title":"Flow matching for generative mod- eling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.844918Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:20ef95181480c1c3193bfbae8e2fb3bf9caba435b1baede31fae9d6a1178af38","observation_id":"979c8d7c-b35b-43ba-8cf9-a9de75b976ed","resolution":{"observed_at":"2026-08-12T19:55:33.844918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.814131Z","title":"Deep learning face attributes in the wild","venue":null,"work_id":"0dde0d70-ab40-4e30-a875-87c5d1cbfb4a","year":2015},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.849903Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:bbed268b53d46af06aa3f98bd1be0515f59a887b49bbece4786f8233c01c44e8","observation_id":"1adab2c7-8ce0-4b10-85b8-f579c6a30ca3","resolution":{"observed_at":"2026-08-12T19:55:34.819810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.798236Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":"66889f57-75dc-4274-ab2c-1f64cc48709b","year":2019},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.854614Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:a9905188d5f1d2082285fe15f4b4eda26c9ecb15cffb098bd5d7056850022239","observation_id":"adf1b692-206d-44fe-a536-fbc1bd1337bc","resolution":{"observed_at":"2026-08-12T19:55:34.803417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.782108Z","title":"Reading digits in natural images with unsupervised feature learning","venue":null,"work_id":"621d5882-ea89-4a2f-b0ae-5ffabd6ec87d","year":2011},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.859510Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:79ab9a8dcd0895f7250e8f09c8c2551f3ae268965ff8171be826f1d12c02196d","observation_id":"16593243-eea4-4685-9def-de83e41b899f","resolution":{"observed_at":"2026-08-12T19:55:34.787309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:33.864556Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.864556Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:2dbd6e7025eb5a288b8701d7ba2fdb9323b30dffac59edc4746456c986cbecba","observation_id":"6dee6833-6e93-4817-8c10-a2306a1b2026","resolution":{"observed_at":"2026-08-12T19:55:33.864556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.755647Z","title":"Tokenisation and sentence segmentation","venue":null,"work_id":"ca5fec20-5923-4f17-a8d7-7d16e0b6721c","year":null},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.869775Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:e341deff519c811df4587633916619cee3e983f7ce3be752d3043295bb370d28","observation_id":"a95b448d-bb9a-45da-afa1-a00291f015e9","resolution":{"observed_at":"2026-08-12T19:55:34.760989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-14T11:08:32.950294Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-12T19:55:33.874747Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.874747Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:e5722ba10345a230c736ceead967880c0970e36fc90b839ef7447a8d05d8af01","observation_id":"fec46ec3-b2b9-475c-ab2e-56903c590644","resolution":{"observed_at":"2026-08-12T19:55:33.874747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:33.880240Z","title":"Pointnet: Deep learning on point sets for 3d classification and segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.880240Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:960a754794d3f99adb76fa91492294ceef6f20f34431730d3e5b6bc7b864a5e1","observation_id":"daf3a746-00a5-4d71-8179-9fa9adce4bbe","resolution":{"observed_at":"2026-08-12T19:55:33.880240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.727447Z","title":"Improving language understanding with unsuper- vised learning","venue":null,"work_id":"7340acb4-63e5-4ea9-ad71-f0a72be9962d","year":2018},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.885072Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:274e6a68fc9fff554f68f7b3355f23bc43bee73be0db0863187ab7de90e0cce5","observation_id":"ef83cf80-6507-4e89-b0ec-8a97e67a1b09","resolution":{"observed_at":"2026-08-12T19:55:34.733086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:33.889848Z","title":"Language models are unsu- pervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.889848Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:d676220726dde54e9c6936cac30590e6becd18e310d0ab0715a7934fe64dac0f","observation_id":"91fc3779-2a2c-4474-ac1e-1031b3e31d97","resolution":{"observed_at":"2026-08-12T19:55:33.889848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-12T19:55:33.894665Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.894665Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:602f62243df93da112ec356dec5bc2313958921d4deba6db8685168d54ebe1f8","observation_id":"17adc1ba-cee6-4d7b-b41b-35329ce75b32","resolution":{"observed_at":"2026-08-12T19:55:33.894665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.07292","last_updated":"2023-05-23T16:33:55Z","snapshot_observed_at":"2026-08-13T13:43:27.851318Z","submitted_at":"2022-11-14T11:52:55Z","title":"A Novel Sampling Scheme for Text- and Image-Conditional Image Synthesis in Quantized Latent Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.07292","snapshot_observed_at":"2026-08-12T19:55:33.899771Z","title":"A novel sampling scheme for text-and image-conditional im- age synthesis in quantized latent spaces","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.899771Z"},"links":{"cited_paper":"/paper/2211.07292","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:fb0fd9fde1806783e6c35d67cf023375bc9dd68bd95f675e7fa41e29465214f4","observation_id":"a8325e2d-c22a-4389-910d-ed3e98895a3e","resolution":{"observed_at":"2026-08-12T19:55:33.899771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.699262Z","title":"Gener- ating diverse high-fidelity images with vq-vae-2, 2019","venue":null,"work_id":"da52b1da-8131-4aea-9eec-21e840e00f61","year":2019},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.905291Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:e93810812f17373dda073b10e82dacba8de70d1b38c6c676b66a6a993bc5b418","observation_id":"1395ce5d-c3d2-4cbb-bc2d-5bda18942590","resolution":{"observed_at":"2026-08-12T19:55:34.705550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.682279Z","title":"Pixel-level BPE for auto-regressive image generation","venue":null,"work_id":"9f3729df-ae0e-4d42-9452-fc61f5a55b84","year":2022},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.910109Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:fd19c291f1103725f55738cc4a9bc5b61223b3f3a8fa398c788f3a7296784442","observation_id":"54bcb473-87b0-4548-8355-ac2feb1b5910","resolution":{"observed_at":"2026-08-12T19:55:34.687956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04597","last_updated":"2015-05-18T11:28:37Z","snapshot_observed_at":"2026-08-14T05:43:53.421538Z","submitted_at":"2015-05-18T11:28:37Z","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04597","snapshot_observed_at":"2026-08-12T19:55:33.914842Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.914842Z"},"links":{"cited_paper":"/paper/1505.04597","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:9153e68ffde8dd3fe01d9e8920782ca945e11848f62a6ea18388cfffa5c84510","observation_id":"61a89d1c-3db0-437a-bd9a-eb30d8d34110","resolution":{"observed_at":"2026-08-12T19:55:33.914842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:33.920010Z","title":"Learning internal representations by error prop- agation, parallel distributed processing, explorations in the microstructure of cognition, ed","venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.920010Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:8f88fd4cb67c444eb44ed8c0727edc4e93ce7c488bf8ab89d83ddd7985d74c6c","observation_id":"59439e50-7832-4fa0-9641-1b632efa1e3d","resolution":{"observed_at":"2026-08-12T19:55:33.920010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.631371Z","title":"Learning factorial codes by pre- dictability minimization","venue":null,"work_id":"3d66690f-6d76-4e20-be83-c94b5d8fb776","year":1992},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.925218Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:d44b4bcf1d53608660a14a40d5715eb05ea359e9003119f6afe8c963727b4808","observation_id":"7a2982ee-ee3c-46e8-a1c9-e9251f89ebf3","resolution":{"observed_at":"2026-08-12T19:55:34.636553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-08-13T18:41:35.355818Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-12T19:55:33.930802Z","title":"Neural machine translation of rare words with subword units.CoRR, abs/1508.07909, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.930802Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:4aca5fad6cac41300ada4e7e50ba19f07d314a5630ed6d8c9df23fc9025cb88f","observation_id":"714bdddd-960e-4683-a272-810a815423f9","resolution":{"observed_at":"2026-08-12T19:55:33.930802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.614390Z","title":"Bivdiff: A training-free framework for general-purpose video synthesis via bridging image and video diffusion models, 2024","venue":null,"work_id":"cab302af-b40e-4b5f-99ba-96d49385ab1f","year":2024},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.936556Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:7f6ae2af5142190c3bcedec73f1db06ea8d48d16f9f86c859a3b738ffc0c9af3","observation_id":"66fe46af-df7b-4bb3-8945-b3e371ab05a0","resolution":{"observed_at":"2026-08-12T19:55:34.619927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.597076Z","title":"Byte pair encoding: A text compression scheme that accelerates pattern matching","venue":null,"work_id":"fb907f98-de7b-4ad6-96a4-37e9a621c6f2","year":1999},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.941500Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:81ec3f387d94e50adadbc94f1968ce8b6ef9d437f4219def2898ea9f5c99ad3b","observation_id":"2fb78196-e51e-4f3a-9a56-b103914ff894","resolution":{"observed_at":"2026-08-12T19:55:34.602589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15524","last_updated":"2021-10-05T22:18:32Z","snapshot_observed_at":"2026-08-14T08:37:40.498406Z","submitted_at":"2020-12-31T10:01:29Z","title":"Fast WordPiece Tokenization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15524","snapshot_observed_at":"2026-08-12T19:55:33.946468Z","title":"Linear-time wordpiece tokenization","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.946468Z"},"links":{"cited_paper":"/paper/2012.15524","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:a73c32e9fdcb186108eb87e57b2b4da0da4cf46e3933971e2eff6364415d3033","observation_id":"75c103f8-5879-424c-9b56-c1a035bfb305","resolution":{"observed_at":"2026-08-12T19:55:33.946468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.12539","last_updated":"2023-09-14T12:34:51Z","snapshot_observed_at":"2026-08-13T17:47:22.790141Z","submitted_at":"2021-10-24T22:15:01Z","title":"Discrete Acoustic Space for an Efficient Sampling in Neural Text-To-Speech","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.12539","snapshot_observed_at":"2026-08-12T19:55:33.951728Z","title":"Discrete acoustic space for an efficient sampling in neural text-to-speech","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.951728Z"},"links":{"cited_paper":"/paper/2110.12539","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:6d32ba30e9740af86f5e3c61df682a99c79e9d310964b1051c4037e3585c0401","observation_id":"92f77b95-8858-4a4c-aa19-4909722102cb","resolution":{"observed_at":"2026-08-12T19:55:33.951728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-14T03:33:46.294739Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-12T19:55:33.957102Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.957102Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:c16cb3899b2804f967f0061f74394e59f35f5349f036509284376baa12768ec7","observation_id":"b58040ac-0c04-4d85-8c23-b4dfdd694453","resolution":{"observed_at":"2026-08-12T19:55:33.957102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.4842","last_updated":"2014-09-17T01:03:11Z","snapshot_observed_at":"2026-08-10T12:32:10.061920Z","submitted_at":"2014-09-17T01:03:11Z","title":"Going Deeper with Convolutions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.4842","snapshot_observed_at":"2026-08-12T19:55:33.962083Z","title":"Reed, Dragomir Anguelov, Dumitru Erhan, Vincent Vanhoucke, and Andrew Rabinovich","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.962083Z"},"links":{"cited_paper":"/paper/1409.4842","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:a9d0cb47778792b1a870de5fb7e34d6e9f6ddcbbbaa07036de7e2a6cc3c697f7","observation_id":"814094dd-498e-4ef0-ab18-1c3bc8b57b9c","resolution":{"observed_at":"2026-08-12T19:55:33.962083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00937","last_updated":"2018-05-30T14:58:27Z","snapshot_observed_at":"2026-08-12T15:49:46.862002Z","submitted_at":"2017-11-02T21:14:44Z","title":"Neural Discrete Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00937","snapshot_observed_at":"2026-08-12T19:55:33.967111Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.967111Z"},"links":{"cited_paper":"/paper/1711.00937","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:7a726fa6273b7a81dcace9ab2dd88d70cc1cc5c652ded702deca66e1ecb137b2","observation_id":"808182e0-bfda-44d7-be35-f371a6629fba","resolution":{"observed_at":"2026-08-12T19:55:33.967111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:33.972203Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.972203Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:b6c5aa5ef13a9a29ee3b654894565be573be5e0ff7b15f36356a80eeeeaed7de","observation_id":"8a807fe2-2940-40a6-9025-bc9863e2c81e","resolution":{"observed_at":"2026-08-12T19:55:33.972203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.569813Z","title":"Vector quantized wasserstein auto-encoder, 2023","venue":null,"work_id":"aa5d667f-aba4-4e16-a521-aba07d76b4bc","year":2023},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.977044Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:310469e34f16fb16386224dbd5981371761dca006534e7edd5ad8dd3845d79c1","observation_id":"b92d2b4b-1247-4ac4-ac90-bc06bfdc1202","resolution":{"observed_at":"2026-08-12T19:55:34.575084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13660","last_updated":"2024-08-09T20:18:57Z","snapshot_observed_at":"2026-08-14T09:25:21.187461Z","submitted_at":"2024-01-24T18:53:53Z","title":"MambaByte: Token-free Selective State Space Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13660","snapshot_observed_at":"2026-08-12T19:55:33.981701Z","title":"Mambabyte: Token-free selective state space model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.981701Z"},"links":{"cited_paper":"/paper/2401.13660","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:b577ca9a764ee35d95fd0925ac701cbde608c699d63d37e1ffcb7e21591302af","observation_id":"c59f94b3-4fc9-47aa-b337-e09ee4e5a6c3","resolution":{"observed_at":"2026-08-12T19:55:33.981701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.553133Z","title":"Vector quantization-based regularization for autoencoders","venue":null,"work_id":"67841000-98ba-4800-8f49-2b0310b29f79","year":2020},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.986838Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:bee4e89fd984fd76c3a0142c8d461c289a637ed38dfbfe5ac73cef555950f280","observation_id":"90004061-2dae-4b6f-8bbb-2fb072ab3d08","resolution":{"observed_at":"2026-08-12T19:55:34.558188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-13T14:30:50.605700Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-12T19:55:33.991891Z","title":"Videogpt: Video generation using vq-vae and trans- formers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.991891Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:c16ab6333883827716bf0a92d6949cfd4f7c67a49bfdd09eed732fb95cae7261","observation_id":"ee0dfa02-ab75-41cc-b417-28b33c2abb92","resolution":{"observed_at":"2026-08-12T19:55:33.991891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07550","last_updated":"2024-06-11T17:59:56Z","snapshot_observed_at":"2026-08-12T23:45:15.377628Z","submitted_at":"2024-06-11T17:59:56Z","title":"An Image is Worth 32 Tokens for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07550","snapshot_observed_at":"2026-08-12T19:55:33.997127Z","title":"An image is worth 32 tokens for reconstruction and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:33.997127Z"},"links":{"cited_paper":"/paper/2406.07550","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:8994e051d42f70dd16dffe4f303138150ea069738a5f29f6d929815caa127dc5","observation_id":"222f05fb-9389-41ce-b7f1-7eb854b0e5f6","resolution":{"observed_at":"2026-08-12T19:55:33.997127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:55:34.536617Z","title":"Online clustered code- book","venue":null,"work_id":"57d07c3a-c2a1-4dfa-97b8-f3bacb1e197b","year":2023},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:34.002156Z"},"links":{"citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:1ef8b5892ac5c8a192c4ff18a2091f4987f2832783176cdeb35c66643a91724d","observation_id":"cbc89bd6-16a3-4448-a62a-c44cffc4f359","resolution":{"observed_at":"2026-08-12T19:55:34.541979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04632","last_updated":"2023-06-07T17:56:02Z","snapshot_observed_at":"2026-08-13T11:22:24.551370Z","submitted_at":"2023-06-07T17:56:02Z","title":"Designing a Better Asymmetric VQGAN for StableDiffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04632","snapshot_observed_at":"2026-08-12T19:55:34.006981Z","title":"Designing a better asymmetric vqgan for stablediffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T19:55:34.006981Z"},"links":{"cited_paper":"/paper/2306.04632","citing_paper":"/paper/2411.10281"},"observation_digest":"sha256:d67c4fe4de009e519d97484b1136b77afe2fc8ff994906989da8ef1bdefcbf51","observation_id":"913398fe-5673-4c4a-930b-5d49ff4f8cc2","resolution":{"observed_at":"2026-08-12T19:55:34.006981Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.10281","last_updated":"2024-11-15T15:36:48Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T01:01:33.920781Z","submitted_at":"2024-11-15T15:36:48Z","title":"Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data Generation"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":31},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 1 inbound Pith citation observation for arXiv:2411.10281."}