{"as_of":"2026-08-10T14:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f12a2d7bdee65a2410bd96dd93ffddabb372ed8b541b826775fdee283452cbf","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T15:39:15.744954Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.01911/citation-record","integrity":"/paper/2606.01911/integrity","json":"/paper/2606.01911/citation-record.json","paper":"/paper/2606.01911"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Efficient-vqgan: To- wards high-resolution image generation with efficient vision transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:12a15880ba2f4021e92bbef4beeb88c0ff8af2777aa6a7a6f0d880d95362bf70","observation_id":"84d4a13c-076d-433c-96ec-7af92811463a","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:bbcff5b683cced6d07bcd0927aa9b48609f49d61eb1398e4d7ffebba30e88880","observation_id":"8671d9d9-3181-452e-b3a7-5db9f5f7b694","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Softvq-vae: Efficient 1-dimensional contin- uous tokenizer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:b850dd276a1ba8c6b438b3002c5fc6070c0d53c7e240743f23ed6da5aac6c458","observation_id":"5d6cf722-45bf-4684-83cc-64aa2ee7a75a","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Textdiffuser: Diffusion models as text painters, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:f2e0690a1a169f98904a0ee52fb77bece0c5317d563a3926f3915a5edb4a575f","observation_id":"96ef95ec-9411-4a5e-b5d4-81e88b48039c","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Blip3- o: A family of fully open unified multimodal models- architecture, training and dataset, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:6de368547c5984e9b3b7386f8d58a33751ca130f84ab53ec3725e6386b274cc1","observation_id":"aa68bbc6-79d8-4158-b629-c48becafca55","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Janus- pro: Unified multimodal understanding and generation with data and model scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:3edef251682179da619a6eef113902b970b634b15c6cff734abb884ca37ac72f","observation_id":"a52712f6-0746-4499-9726-9989d1753cf7","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Paddleocr-vl: Boosting multilingual document parsing via a 0.9b ultra-compact vision-language model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:3bb6f415bb99e66375054253798ec98de7d47db652f15d7a43fa7a503abe6ffe","observation_id":"d22bdeb7-8cee-4fa9-a231-e74f51984567","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Paddleocr 3.0 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:5c80747a06e64cbe28398fa31a47f4e4d11a82e0f7e87ca5f8b4bb5e0eecf6b4","observation_id":"b55fd121-4881-4a56-8b32-7e5209aed037","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Emerging properties in unified multimodal pretraining, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:79364572e812f8590d013ab98db6dfc07822bf5276c55eef2fd95bda056d92d0","observation_id":"1e59ac32-b4e0-4254-aa80-79bc8c9dda3f","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Cogview: Mastering text-to- image generation via transformers, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:3dde43f7ab10357cde4c4dc1c78a852a9dbff3a8c30faf7bbf5440c753175d95","observation_id":"d60d169a-2e43-455d-a89a-42d46209cd5d","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Textcrafter: Accurately rendering multiple texts in complex visual scenes, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:ffcd87359c096ec3371a8e47c4d29dd604905a2f5660baad391060a815a87f0b","observation_id":"9e7f0d52-0bfb-421f-a0f3-5bf12562f2b5","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Taming transformers for high-resolution image synthesis, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:d96730a153add2e42af1d9fcd2ac66f9c2414079b27a2217766eb6984c43b70b","observation_id":"8fbdda5e-995f-4fa1-93b4-853199aa0e43","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"D-ar: Diffusion via au- toregressive models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:c107e2602aab25a9909b74fb9fb0cc4d6a3ef72cb5015348cd684bbe94ee44f9","observation_id":"9da316e0-0e0b-46bc-ad4d-436c51228666","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"X-omni: Reinforcement learning makes discrete autoregressive image generative models great again, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:f60a1298e91b7413434daf4676fc31d3fd065cd404b1eea34f60f29162bfbf73","observation_id":"8346a156-16fe-4566-9159-f5b6e419f57a","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18898","last_updated":"2025-06-23T17:59:14Z","snapshot_observed_at":"2026-08-06T23:12:29.776991Z","submitted_at":"2025-06-23T17:59:14Z","title":"Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations","version":1},"cited_work":{"arxiv_id":"2506.18898","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18898","snapshot_observed_at":"2026-07-04T10:09:44.750475Z","title":"Vision as a dialect: Unifying visual understanding and generation via text-aligned representations.arXiv preprint arXiv:2506.18898","venue":null,"work_id":"eeaabcd0-b12e-4324-88d6-d54239671f08","year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"cited_paper":"/paper/2506.18898","citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:48cfc61a7cb04bf571bc26d1f2c6c0e572aa6865e922d8a64e0961509af70c06","observation_id":"3687ca55-3ff9-4e3f-a0bc-71af85e59c14","resolution":{"observed_at":"2026-07-01T22:16:15.745397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.10772","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T11:46:55.462981Z","title":"Flowtok: Flowing seamlessly across text and image tokens.arXiv preprint arXiv:2503.10772","venue":null,"work_id":"bb1269c2-d12f-4b4a-9a4b-b655ba12db8e","year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:3cd33eb3631d50921e244b87a55a6ca2be5dd85e4ab4a843ff44382f577e4b0d","observation_id":"9f7d4dca-f645-4a9e-9590-ffa86f1dc3ec","resolution":{"observed_at":"2026-07-01T22:16:15.734967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Rear: Rethinking visual autoregressive models via generator-tokenizer consistency regularization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:71978d1a5381c29b0f8697d3a9863308ccfa9c9f46b752cb344dce2f16586147","observation_id":"b7aa1964-ef95-4e3c-b6e7-a9b43942feec","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Plangen: Towards unified layout planning and image generation in auto-regressive vision language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:00025d3b4da09e3fd713847e9f6e8fa8b5967916163ded51560cb0222c61d6d4","observation_id":"206687de-7616-4d95-ae15-2199076ccb4f","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Denoising diffu- sion probabilistic models, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:fc8cb7cea9ab8556d2171e03b31bed29d6a67c7570b45a6b3bb5aff20b6a5ab6","observation_id":"5f5df810-a32f-4a3f-95aa-d2d422e9ae37","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Flux.https://github.com/ black-forest-labs/flux, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:70185981d56a1e36a2ece59cbd01e54ba2a191e51ebd03eef73428a8f5ab7ffe","observation_id":"04dab875-d3b6-4b1d-ab30-96c41dce988c","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Unleashing in-context learning of autoregressive models for few-shot image manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:2a236cb8ba68594e457867a0a0e685c06bfb4ffa00bd80b2a3d1dc7d6ffbd2f7","observation_id":"7989ab84-de44-450c-adc5-358b0af6d990","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Photo-realistic single image super-resolution using a generative adversarial network, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:c44edd73fa34ebfe109f850e956463d09929f3824346d2703b3b8cd690c0ba16","observation_id":"2426eb64-4c45-4774-8331-dd0e82e81024","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Draft-and-revise: Effective image gen- eration with contextual rq-transformer.Advances in Neural Information Processing Systems, 35:30127–30138, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:a13cacddbb430d35c39ebc2141f87abc6c8c6994e7020731cb8fd32e33e95b94","observation_id":"0c8fb87a-e8c6-451e-9a15-a6431372b68a","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Autoregressive image generation using residual quantization, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:7a5e64126c122ddb2864fc8e280438c13b2608766dd813b417d1c4279c787047","observation_id":"b57906cb-d3ad-43db-a766-994c5d763d5b","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Vt- bench: Evaluating visual tokenizers for autoregressive image generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:930f895730196f141aafe2a44a952082a643a488c75d24427a06067f910d6e5a","observation_id":"052a591c-bedb-44e2-9833-7b7391fec011","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text- to-image generation with multimodal generative pretraining,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:2f0de37801acda806068e3c71562e1d1a39078de0355162192f688116487a7ab","observation_id":"4618e59e-c303-48aa-a055-c39eabdf4add","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:51915cf6abcc52c9ac879508ee788f0fd175cae824b3891c28c01268db4e336d","observation_id":"f148564a-c58b-4cbc-b20d-7a616eaecfdf","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-06T03:43:29.067278Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":"2409.04410","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-07-04T13:09:50.831210Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual gener- ation","venue":null,"work_id":"a2523977-d17d-43e1-8c06-1f6ba1c28388","year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:2214f120a992e50a666a43622d96f658b3495e8863ba713e9869c014b4550356","observation_id":"7a1ae1db-0ab0-4a4a-97e9-2588ba7329d7","resolution":{"observed_at":"2026-07-01T22:16:15.740095Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Unitok: A uni- 9 fied tokenizer for visual generation and understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:f5a87c92840bba28a0afe2ba6755847115010018b9669db80ec3a4d3c8df6a3d","observation_id":"e25a254a-ade5-458a-82c3-072ab01e9aca","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Textground4m: A prompt-aligned dataset for layout-aware text rendering.Proceedings of the AAAI Conference on Artificial Intelligence, 40(10): 7918–7926, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:9a589a467abfc74faae497fb9d25f646d9d58d464a015891827a30d3ba702edc","observation_id":"940ec236-2923-447c-8c0f-48a08d75eeaf","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Hello gpt-4o, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:cfb1da9e3ba6cf8369727bfbc315e80a616c602eb83062cc51ccd3f07abe1dec","observation_id":"7ef17556-cf28-4a45-9f25-74e1c07836a6","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Janus-pro-r1: Ad- vancing collaborative visual comprehension and generation via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:026dce7b5a4b1dcf3c7887bb76e8673bdf04c4ef597aa65b4ef1f36973a6cc16","observation_id":"85d29aff-36ab-4ebc-a8f0-7c323f3294e6","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Im- age transformer","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:6b48fc526d7e94d651788ef01c76be2963551962c6a0e5b40c65b371bf23101b","observation_id":"e1050b96-f101-46d7-ab70-eb22190db4bc","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Scalable diffusion models with transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:7b43facab294d6009ebee0a993cbfa3114de3b1b1e0a488da976620cca484678","observation_id":"965217c3-7293-4b2a-83aa-9bd22c94bb43","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Du, Zehuan Yuan, and Xin- glong Wu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:0c541b830d1e992084c4eb98369901d1ab3cfa0a8220028c2b7c79d1aab67951","observation_id":"7b1ffbb8-dc0f-4923-84c6-d9108f18a211","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Zero-shot text-to-image generation, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:8857af81bdf52803f9aec342bc2aba22c094ecd48ef7e6abdc01e67c5438c94d","observation_id":"21a17780-8058-45f0-8c00-acf0f386719a","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Gener- ating diverse high-fidelity images with vq-vae-2, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:a9bc57b75c1c61c91e4381ef0677f93d191b63972d63740910b5b246338701b0","observation_id":"2f0ad994-4c3b-4c7b-b3fc-85c91c3b8db3","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"High-resolution image syn- thesis with latent diffusion models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:d03915804d46e67842ee99aaf0f9a81e8f009765e19d96cedf533c0642bdcdf2","observation_id":"34737376-6930-4226-bd7b-64cae19633a7","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Sara Mahdavi, Rapha Gontijo Lopes, Tim Salimans, Jonathan Ho, David J Fleet, and Mohammad Norouzi","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:3cce7e399487d9a5c8b3828ca3ebe4636ad09bc7f45ed93ea5914c6c68a9bc12","observation_id":"22ee4f31-9642-45b2-9894-ce4c80816767","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Very deep convo- lutional networks for large-scale image recognition, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:d379329dd6f0770d780a7599a779f5940d57d22c95ce76fa8f3e5215ab22b324","observation_id":"199ff914-243d-4fb8-8450-fcedb0d9d883","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Denois- ing diffusion implicit models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:0ee72371128f98dfd4857e0ea49ba93e14edc34bbac953d4653a272341cb27c4","observation_id":"e3060709-217e-45b1-aed9-f92140552e66","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:c2baec511798779ddfa0f919620e52c3deabcbbd90e099c2e76bd847e27f5162","observation_id":"0166f496-7245-444f-8c0a-8ffb99af42e6","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Chameleon: Mixed-modal early-fusion foundation models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:cfde193af1b8fc0c7f20e0a9a89c74094d03815940c3d14d6affdde25639e280","observation_id":"36d8027c-fd4a-457f-9522-fdf6c082d0fd","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:767e00a85842202bcbd70c1c0f6e05760dd601b26f59497fe59ec6edb9e25f55","observation_id":"fa427dc8-4abe-491e-a3b2-3416948cbd8a","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Metamorph: Multimodal un- derstanding and generation via instruction tuning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:da35a4f533b8610eb18f18546d0fb05fa4601691b8fff3fdc6d1e1d44c05ef77","observation_id":"e03e88ab-c840-45cf-b37f-ac5c873ea6f5","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Anytext: Multilingual visual text gener- ation and editing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:a2a7399be63bc190f7dde66bd6d0de3d8fba84b11fedc87c380144e7baa035a3","observation_id":"92fb6bd9-cb7e-448e-855c-a1393f7928bc","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Neural discrete representation learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:fd7513df729b875e929328fea22fe9de29875f71df2bcf8dc74da06529fa34c6","observation_id":"a6a09a0c-23c3-4423-80d2-8aceb6f8b2ed","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:2fd9c079d48d1c492cba268e36d95bcaabd6f33bd0d061d7b008bec3c123ba7f","observation_id":"e82f315e-bcd7-4a6c-ab21-0a44bd71a4c9","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Beyond words: Advancing long-text im- age generation via multimodal autoregressive models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:bcd32dd99588dfa98cb4f64d0ce9a995c464bd7cf0376aeb64517a474ea4a981","observation_id":"5427aecc-b855-4453-87ba-638a9fdc1d6f","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Textat- las5m: A large-scale dataset for dense text image generation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:57ef59d474e7d1ebf5c753e398b371c62eea0c0f4d10a2817a078bf4c0067901","observation_id":"15d66f9c-b175-46c2-8864-5addc3c100e0","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Emu3: Next-token prediction is all you need, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:b3e29d9f477b45d55191b355f3ecd6e021480250bdcbff3689354c88e4e80231","observation_id":"fe0f6595-77d7-4641-986b-a5853b3475fe","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Edge-enhanced feature distillation network for efficient super-resolution, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:4a58a4354c1f8bd815d15d08bf12638fa975d1151c5eca2fbd13a0e931a1dc4f","observation_id":"349366ed-76a1-4535-896f-3eba36214e17","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Autoregressive visual tracking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:bf93377204db8af97ccc43acc202aba355f078d364aeecde5207cf5035c53fb9","observation_id":"21c76b93-28b0-44a6-affb-6acc73e886b4","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and genera- tion, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:64a9a3b25dffabd62bc8423fcfa78b0b6d5f84093b026e188abba0f7b1a45239","observation_id":"cb9f19e8-a502-42bc-9b21-fe551c561085","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Qwen-image technical report,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:056c573d313dfcb1684e16e0a0fcbbf20a7eb5eb724b083ceff52e946e82c976","observation_id":"d516eb55-b8c8-493d-a498-6d8e3310826a","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Vila-u: a unified founda- tion model integrating visual understanding and generation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:37baca78b68edb230e64d342e9320283536470693a74314609302f9952706265","observation_id":"c8c1e1de-1f72-430c-a84b-da1b93988149","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2505.19874","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19874","snapshot_observed_at":"2026-07-01T22:16:15.736010Z","title":"Stylear: Customizing multimodal autoregressive model for style-aligned text-to-image genera- tion.arXiv preprint arXiv:2505.19874, 2025","venue":null,"work_id":"0c15b805-e32a-4f84-9fd1-deafdd5ce673","year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"cited_paper":"/paper/2505.19874","citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:985926afeb1e7d971a303861d810196d026bb0b48323037d768ba3394e4b04a3","observation_id":"0ef21c97-a801-42c5-9cf6-f5d435d29a09","resolution":{"observed_at":"2026-07-01T22:16:15.737555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Sana: Efficient high-resolution im- age synthesis with linear diffusion transformers, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:545ffbd52b372ab791f290b3a9f1cfc6c980f15f434715d4b1f69d6a1b8dcd80","observation_id":"80e5f71a-4ede-4141-9176-b9c730a719f8","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Sana 1.5: Efficient scaling of training-time and inference-time compute in linear diffusion transformer,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:9bc86586cf5ae02f65b4461c3efea220419735bace6951407e4aa3f9427a8aa9","observation_id":"eec97dd5-5875-48f1-b50d-52b3a6adc65a","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Lumina-mgpt 2.0: Stand-alone autoregressive image model- ing, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:8ffff2d07a3ca2c2943ee4689c90a7a0def2997c4da2a71c44862ac12899d534","observation_id":"2a736dac-29f0-4080-8ea5-e5447ba6a2d2","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Gigatok: Scaling visual tokenizers to 3 billion parameters for autoregressive image generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:dc71bd80025b334e8671e13a41c4a664b37c8ff7e09e338294a9fffdb6f5ed8a","observation_id":"9f8d8736-e5be-4b23-b158-2679537e9488","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Vector-quantized image modeling with improved vqgan, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:43a1edaf56f1d38ae34fa84ff081cae13c7dee6d0d23502f0328766d79d5b638","observation_id":"dd42602b-959f-418f-bc50-a9f7b670458c","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Randomized autoregressive visual generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:0ec69c1f96eb50a28b2b016e9b871193430c61147ce95563309af0ef246535af","observation_id":"dc66bf53-9459-4617-8aca-e92dbae2054f","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Regularized vector quantization for tokenized im- age synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:74cc4a505c733e76152c8b9a4e26daf60403b843519eb63d9bfdec8aac8912f4","observation_id":"de16643e-ba72-45d9-b6ef-8b741acce30a","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.03650","last_updated":"2022-07-15T02:15:30Z","snapshot_observed_at":"2026-07-06T13:07:37.780644Z","submitted_at":"2022-05-07T13:13:55Z","title":"Distilling Inter-Class Distance for Semantic Segmentation","version":2},"cited_work":{"arxiv_id":"2205.03650","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.03650","snapshot_observed_at":"2026-07-01T22:16:15.741175Z","title":"arXiv preprint arXiv:2205.03650 (2022)","venue":null,"work_id":"4edccde9-92ec-4c11-9cbb-636de01b78db","year":2022},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"cited_paper":"/paper/2205.03650","citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:8b6faeaf064f376c379b91be912c63378e34eac8d1817a2781989df102c4a784","observation_id":"2ed570ed-756f-4582-943b-ae8a3e520d0e","resolution":{"observed_at":"2026-07-01T22:16:15.742625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Diff-tracker: text-to-image diffusion models are un- supervised trackers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:ad2340db016e3d1214fa8cb74b3f20001233f6f938d1a64ec8333e9fe87f7ab6","observation_id":"2ba6c6e8-6e18-40c4-8a09-e6ee8b5f7eef","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Performing defocus deblurring by model- ing its formation process","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:61525113e6c739ba9f5af70b2170984d4dbc9262ba230ccdbe5ea8196842d259","observation_id":"e3e8d907-4dd0-4534-a6d4-ecd02cfe841c","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Visual prompting for one-shot controllable video editing without inversion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:6cda3c8c1fba142aa128069449fb55188fa8cc91a435cf315a33c8187e6ebe37","observation_id":"72a2da84-6fb1-44c5-a8af-939fa9a77904","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Movq: Modulating quantized vectors for high- fidelity image generation.Advances in Neural Information Processing Systems, 35:23412–23425, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:ddb9a644cdc19a77f05abd20794f707fa3cbca01ab51c673af413abc68d7a773","observation_id":"0a6ee3f8-de01-4f11-acbb-0e2468d2a9c3","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Shared-ID Hint Codebook","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:8d4852247f410766efee868bb5d63c6451cdceb96c8e4eb582f17cd6ed7b132c","observation_id":"6d03612f-66d4-4738-b8dc-0847f903e505","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Implementation details","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:e59d71d6c30245cfd371f9f72e6a9bba4eadf59cc977d49e9e2e0e28468ef21a","observation_id":"82b5e3b0-ed2e-476f-bf13-d519e0182b13","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Model Architecture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:0eeb14153365bd7b3b3a6bfddb186adced1b4cd52b530e9be37bc71e4085bdff","observation_id":"ab512638-2452-4f52-b79f-a143fe3fa574","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Parameters and Latency","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:836b9a6c41f5355eddc8b216b16264de90ee8c475f823d463f9297da13eeccc9","observation_id":"6e49e047-323d-41dd-b474-99ecc8a0f6ce","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Tokenizer Reconstruction Limit","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:d8bcb538cb95655754f4b741ed52cf5297d950ef97dab69740df4b6c31b02c05","observation_id":"abc1ed11-b4ce-4994-a6e5-8c7a7f3a099b","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Model Architecture Hint CodebookWe instantiate a paired codebook that mir- rors the size and index space of the original tokenizer code- book","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:7ce742825127b40e7b5cb0fdd785e8339a7ea106273c72ce7f40001483322647","observation_id":"c2df0dd5-30d6-4d08-bcfb-9c8eef6dae22","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Parameters and Latency Tab","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:504353c18bc1d943c838f6b09b0c84f0db1b508d851aa28b51425c1e456e4d10","observation_id":"eeb35c84-a469-490e-9f25-85958291fecb","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Tokenizer Reconstruction Limit We verify that the base tokenizer exhibits inherent recon- struction limitations even when provided perfect ground- truth input","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:e6c1d10410099eb20f008393fd92e1350d622672ffab83a4c560715dda62c05e","observation_id":"2590dfab-48a3-42ce-893b-3208a35013d8","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Tokenizer-Level Failures When characters are extremely small or visually ambigu- ous, the tokenizer may assign incorrect visual tokens, lead- ing to unrecoverable errors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:8f3d81ee183efe341ef48ac464dee4fae4456e310748438a2f318e739d07f792","observation_id":"87fa9167-65b7-4e48-9a2d-a5f090de1182","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Training Stability and Convergence Fig","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:798b853b82fafe54c1ac7f070b1ce1bd26e37460af21d33336d8f23957adb9d5","observation_id":"5ef6ee9f-2db6-487b-9393-8416d77bb1d2","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Why Shared-ID Preserves Compatibility The Shared-ID mechanism ensures that the token ID distri- bution remains identical to the base tokenizer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:07a5cc244ffdcbc8bd01e388d376cdc1e6e919d87443421f87d5c60832ec98fa","observation_id":"5f79b6ba-8353-4157-8e96-9a35684fc0a8","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Tokenizer Results on Additional Datasets We also conduct evaluations on StyledTextVisionBlend and TextScenesHQ of TextAtlasEval [50, 66–69] to assess ro- bustness","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:d20687551beae22df40749b3b465cd63dcca13ff2782dffc311999365079721e","observation_id":"ca134d90-e047-4119-a979-2af1d325e7b1","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":"Tokenizer Reconstruction Results We evaluate the reconstruction quality of different im- age tokenizers, including LlamaGen-VQ and Chameleon- VQ [43], across multiple datasets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:6c580e3229f8e1893b5b99b932cbd383263fa2903f11eaa371676032a6cd6531","observation_id":"c8cd67b9-6b62-4f39-9ec3-5103aa087381","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:39:15.744954Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:1bebbeb54ad45c0b53ed63fad2f84e6c32ca0c5949ffdd1a21166bb8f511fc75","observation_id":"81bfd86a-3778-4720-b47b-d67f8702d628","resolution":{"observed_at":"2026-06-28T15:39:15.744954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":4,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":74,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 0 inbound Pith citation observations for arXiv:2606.01911."}