Pith. sign in

Paper Citation Record · LEDGER

Language-Guided Image Tokenization for Generation

As of 15 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 5 inbound Pith citation observations for arXiv:2412.05796.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.05796 v2

Coverage vector

measured 53 of 53 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T20:24:57.065394Z

measured 58 of 58 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-09T00:42:57.247608Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T16:59:58.163269Z

Reference resolution

53 of 53 outbound references displayed

  • verified exact0
  • verified fuzzy38
  • unresolved15
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 42c9133f-f271-4560-af48-b1ef596c2d38 · outbound

This paper cites Modular learning in neural networks.

Language-Guided Image Tokenization for Generation Modular learning in neural networks

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.585998Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.887133Z digest=sha256:bc8867a69f95061a1c10af5948afa1b6ad49e849646676938076219abfaba67c

Observation 65fad209-d5f9-45e6-aae5-67f25f2ce176 · outbound

This paper cites All are worth words: a ViT backbone for score-based diffusion mod- els.

Language-Guided Image Tokenization for Generation All are worth words: a ViT backbone for score-based diffusion mod- els

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.575110Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.891359Z digest=sha256:2d9cea9a710aa748e714185be89af911d94029cc22b2f2e43049ad8b55efe58b

Observation 9076f8a2-027a-4742-ab30-4a08bd5ae1a7 · outbound

This paper cites Large scale gan training for high fidelity natural image synthesis.

Language-Guided Image Tokenization for Generation Large scale gan training for high fidelity natural image synthesis

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-11T20:24:56.895194Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:24:56.895194Z digest=sha256:1263830a3421463b57785e25cd41d204e8380b181f71659f975e243fe6308c0e

Observation d30d2c1f-569d-49b8-9d5d-38186877e27b · outbound

This paper cites MaskGIT: Masked generative image transformer.

Language-Guided Image Tokenization for Generation MaskGIT: Masked generative image transformer

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.557917Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.899072Z digest=sha256:ec1f898da51b73c1f9a110e4f999a4e6d052b5e50506824887459369fd1caadb

Observation 3d823a3c-7231-4767-9b8d-b7b61aea328c · outbound

This paper cites Pixart-α: Fast training of diffusion trans- former for photorealistic text-to-image synthesis.

Language-Guided Image Tokenization for Generation Pixart-α: Fast training of diffusion trans- former for photorealistic text-to-image synthesis

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-11T20:24:56.902534Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:24:56.902534Z digest=sha256:a947ab98970ebf0ba40b20c732452724f0398dd2f00e873a88c17ffcbba260f9

Observation bcbc9597-bd0c-4d26-a62b-2c2e86409bc6 · outbound

This paper cites Generative pre- training from pixels.

Language-Guided Image Tokenization for Generation Generative pre- training from pixels

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T20:24:56.905958Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:24:56.905958Z digest=sha256:7da8e2f495a2101038460a467e7d300f9e3c0437551497916ba30979238a53b6

Observation 261b3f3f-5fa2-4ffc-bc64-d17ce338a759 · outbound

This paper cites ImageNet: A large-scale hierarchical image database.

Language-Guided Image Tokenization for Generation ImageNet: A large-scale hierarchical image database

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T20:24:56.909674Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:24:56.909674Z digest=sha256:f85a634ca28bb057db44b9e5c0c6953ba0b8ae76896e4a1af36b609c276986c3

Observation 006cca75-174a-491b-8a02-fbf8e859f21e · outbound

This paper cites BERT: Pre-training of deep bidirectional trans- formers for language understanding.

Language-Guided Image Tokenization for Generation BERT: Pre-training of deep bidirectional trans- formers for language understanding

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.529983Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.913493Z digest=sha256:08356bd4e9ecd96a27594e7480aa32ef3fb7d693c358496a10d92b7ee1398b59

Observation 4397449c-fa76-4932-8e8c-48c84dc58515 · outbound

This paper cites Diffusion models beat gans on image synthesis.

Language-Guided Image Tokenization for Generation Diffusion models beat gans on image synthesis

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.519630Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.916877Z digest=sha256:a4bbcdb350636403b5d4dcef0eacfb0de2e4684d815e7580fbe395f057411735

Observation b397e5ce-8429-41c6-a527-31b289a29cdc · outbound

This paper cites An image is worth 16x16 words: Transformers for image recognition at scale.

Language-Guided Image Tokenization for Generation An image is worth 16x16 words: Transformers for image recognition at scale

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.508564Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.920175Z digest=sha256:538b44468663e4db098be8e3337fe81d971456a3d63f5de61fc9ac63417eaef2

Observation aff36dc5-8aa3-4220-a28c-2a96623d5006 · outbound

This paper cites Taming transformers for high-resolution image synthesis.

Language-Guided Image Tokenization for Generation Taming transformers for high-resolution image synthesis

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T20:24:56.923781Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:24:56.923781Z digest=sha256:aa42e4b54d98686881c2c8ac4fe6a69f996a2c873172d47169f7901a51a50113

Observation 51828b27-bbeb-4bcb-b886-ecd0ce255ee6 · outbound

This paper cites Masked diffusion transformer is a strong image synthesizer.

Language-Guided Image Tokenization for Generation Masked diffusion transformer is a strong image synthesizer

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.492431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.927832Z digest=sha256:1fec3e289187deb9a9b45edc1f6779081a703945086e4cc4afb86e13ae0e3227

Observation 349d093e-7802-4169-ad5b-21d42d4d779c · outbound

This paper cites Photorealistic video generation with diffusion models.

Language-Guided Image Tokenization for Generation Photorealistic video generation with diffusion models

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.482094Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.931068Z digest=sha256:1de43d5b680fcd72115223ff61127a4d2f549349e03d0c476243170059b8d650

Observation 3c7cfdbe-c920-4805-bad8-42a870102b92 · outbound

This paper cites Diffit: Diffusion vision transformers for im- age generation.

Language-Guided Image Tokenization for Generation Diffit: Diffusion vision transformers for im- age generation

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.471771Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.934215Z digest=sha256:63ac19733a1cad145f54d7481006f55cab748e2ffa1c65096f4f9c74dbc6705c

Observation 6cfbab91-ae61-47ba-95c2-60fdd82b9ebb · outbound

This paper cites Deep residual learning for image recognition.

Language-Guided Image Tokenization for Generation Deep residual learning for image recognition

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-11T20:24:56.938327Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:24:56.938327Z digest=sha256:ae279886d7b27e63a53afb780147d0a8c2aac17ddddb53f94ca8649f420cd742

Observation cb52684a-972b-4b3d-882c-b086f5ad58ab · outbound

This paper cites CLIPScore: A reference-free evaluation metric for image captioning.

Language-Guided Image Tokenization for Generation CLIPScore: A reference-free evaluation metric for image captioning

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.456116Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.941811Z digest=sha256:1c93075a178ad4718ba1ec736f1be18ef00e2826aa7084b38edc291e6705ee20

Observation 484a8581-725e-4049-b550-5be84fa286b7 · outbound

This paper cites GANs trained by a two time-scale update rule converge to a local nash equi- librium.

Language-Guided Image Tokenization for Generation GANs trained by a two time-scale update rule converge to a local nash equi- librium

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.445460Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.945104Z digest=sha256:bad6484db93e9c4a0638df5427251a15313fc1cf899cc90e5bdb56cbce9b5cd4

Observation 2b8b81e8-968d-40e1-a8f6-147131fb63b7 · outbound

This paper cites sim- ple diffusion: End-to-end diffusion for high resolution im- ages.

Language-Guided Image Tokenization for Generation sim- ple diffusion: End-to-end diffusion for high resolution im- ages

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.435295Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.948391Z digest=sha256:57d3385fbc21524e06ffa073dfa929fd0c27ce1bcbeee0b52f8078554ddd9403

Observation 99e0d9ab-a19f-41bb-8711-fb936b4a1d29 · outbound

This paper cites A style-based generator architecture for generative adversarial networks.

Language-Guided Image Tokenization for Generation A style-based generator architecture for generative adversarial networks

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.425192Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.951680Z digest=sha256:2fb8dff399226a9819d6b84e2ac132904a31092eb2ad26bc501b96f24af84d18

Observation 34222711-2e1e-4791-af0e-d906ff3af672 · outbound

This paper cites Guiding a diffusion model with a bad version of itself.

Language-Guided Image Tokenization for Generation Guiding a diffusion model with a bad version of itself

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.415667Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.955066Z digest=sha256:94f0f9c975d5861a4916ee8ecafcf0b0cffaefffaa642f27df59190e7712eaa2

Observation 5dcfc8f5-7a00-4982-93fa-fd52b48b9b95 · outbound

This paper cites Analyzing and improving the training dynamics of diffusion models.

Language-Guided Image Tokenization for Generation Analyzing and improving the training dynamics of diffusion models

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.406315Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.958457Z digest=sha256:98ef7e19ead4e1297a90a08a190b4e2260e5feb5c551089d18a532b0fa082298

Observation 7e9b5d00-57d1-476f-be80-46aa5e7f96ba · outbound

This paper cites Understanding diffusion objectives as the ELBO with simple data augmentation.

Language-Guided Image Tokenization for Generation Understanding diffusion objectives as the ELBO with simple data augmentation

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.396719Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.961649Z digest=sha256:6f5c859dddfd1cbb0dd48cadcd9b6be4797590b6b5c59a6a0c198d0b5479fded

Observation 36cfc49d-3cf8-42b9-b6d2-bfc148c8d0ed · outbound

This paper cites Auto-encoding varia- tional bayes.

Language-Guided Image Tokenization for Generation Auto-encoding varia- tional bayes

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.386865Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.965004Z digest=sha256:a7a94a4b73442d21965014b261ddac3329d7cd3125d67ab26bee1722bb2cb72d

Observation 84a9fe62-2226-4c0d-8348-83a7cc81a38c · outbound

This paper cites Improved precision and recall met- ric for assessing generative models.

Language-Guided Image Tokenization for Generation Improved precision and recall met- ric for assessing generative models

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.375981Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.968240Z digest=sha256:1588341c37d4b20f5c3e7559e016fdf85484f23943a620dfc93c38cea78073e0

Observation 239e80ea-d2ad-4044-a1af-fce5c61711a9 · outbound

This paper cites Applying guidance in a limited interval improves sample and distribution quality in diffusion models.

Language-Guided Image Tokenization for Generation Applying guidance in a limited interval improves sample and distribution quality in diffusion models

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.365182Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.971492Z digest=sha256:d1f91dfd4e98e61effbd78767f5c093b67ed3335b062edb69ec9582f6ce4c65d

Observation fb795d8f-8c67-4c8b-8f58-9b526ae2b6f1 · outbound

This paper cites Autoregressive image generation using residual quantization.

Language-Guided Image Tokenization for Generation Autoregressive image generation using residual quantization

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.355769Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.974778Z digest=sha256:ef3154eea23fa36b811aa6b65ef4530010467243b9cece7fd9d2bfc88aa8fdc5

Observation 53fe989c-dbde-45fc-9b9d-0fe432773ca8 · outbound

This paper cites Self- conditioned image generation via generating representations.

Language-Guided Image Tokenization for Generation Self- conditioned image generation via generating representations

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.344954Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.977988Z digest=sha256:008a1fa25d31656e4aca63e2de41630f93ce4dc09568cb571868e7e4a7743e3d

Observation dc8207bf-2989-4f67-b947-cd6a05a0df9e · outbound

This paper cites Autoregressive Image Generation without Vector Quantization.

Language-Guided Image Tokenization for Generation Autoregressive Image Generation without Vector Quantization

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-11T20:24:56.981481Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:24:56.981481Z digest=sha256:04dd48c21173a43978b16aa2d66dd2cbfae68f919db8a412c11d81be8d4c6026

Observation 5911106d-75a7-4ae4-beb6-fde536741c96 · outbound

This paper cites Lg-vq: Language-guided codebook learning.

Language-Guided Image Tokenization for Generation Lg-vq: Language-guided codebook learning

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.334691Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.985119Z digest=sha256:290e5b5b1ff71b3d999ae99c168be11e55af13decedfaee0be05b9daf6ea8e9b

Observation 9ba68c1e-155c-42b8-8f83-3f28fe631692 · outbound

This paper cites Language quan- tized autoencoders: Towards unsupervised text-image align- ment.

Language-Guided Image Tokenization for Generation Language quan- tized autoencoders: Towards unsupervised text-image align- ment

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.324396Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.988289Z digest=sha256:8afb0dd2ab0bf339abcc53569e759f882c82743c7f7d1732edeb0519343e48a0

Observation 59b9071f-f014-4c93-901b-4541faf4714c · outbound

This paper cites SiT: Explor- ing flow and diffusion-based generative models with scalable interpolant transformers.

Language-Guided Image Tokenization for Generation SiT: Explor- ing flow and diffusion-based generative models with scalable interpolant transformers

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.313551Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.991618Z digest=sha256:3a2ffeef1413434673fd0e477d9ea86e6ddaea1ab779c86fa457f49f31fd7486

Observation 9f4148fc-e360-4663-95fa-1b98eb05188c · outbound

This paper cites Scalable diffusion models with transformers.

Language-Guided Image Tokenization for Generation Scalable diffusion models with transformers

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.302171Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.994727Z digest=sha256:032efa05c665be2387467f6e1759aeb974a009736fcbfd5cbbfe5ef6e9e43d06

Observation 039b8b82-2dfe-4652-8026-2ac400188e9d · outbound

This paper cites W ¨urstchen: An efficient architecture for large-scale text-to-image diffusion models.

Language-Guided Image Tokenization for Generation W ¨urstchen: An efficient architecture for large-scale text-to-image diffusion models

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.290744Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:56.997981Z digest=sha256:e548385196585b073c94f5e2e4997b5b299b97d8019826d2ca30e3c0a4dd0d6c

Observation 6da20cc8-e8b4-4920-80b7-9d8a0eb70712 · outbound

This paper cites Improving language understanding by generative pre-training.

Language-Guided Image Tokenization for Generation Improving language understanding by generative pre-training

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.280401Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:57.001227Z digest=sha256:f6a435730a262ac10d233fedf1584fdf26ebf0bf6b6cec018bfc7c3c0a32249c

Observation 78ba58a8-301d-44ec-b798-48693298cec9 · outbound

This paper cites Exploring the limits of transfer learning with a unified text-to-text transformer.

Language-Guided Image Tokenization for Generation Exploring the limits of transfer learning with a unified text-to-text transformer

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.269609Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:57.004748Z digest=sha256:37edfa2e2578c94fb8d3d947cdd451107133e53204f1ee418a56da3b55f3abe8

Observation 4e0f2d3f-1fde-4e53-a314-996a30fa8428 · outbound

This paper cites Gen- erating diverse high-fidelity images with VQ-V AE-2.

Language-Guided Image Tokenization for Generation Gen- erating diverse high-fidelity images with VQ-V AE-2

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.259376Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:57.008183Z digest=sha256:60d643e09a67b95423e0cb11cab9f94249ea6b89b956a9a5f8220c239a6637ef

Observation 540ada97-e0ed-4ba7-8939-496021af66b0 · outbound

This paper cites High-resolution image syn- thesis with latent diffusion models.

Language-Guided Image Tokenization for Generation High-resolution image syn- thesis with latent diffusion models

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.249012Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:57.011481Z digest=sha256:991b6ed84320f978d19f83c68db14478ab9ea0822cc7f7282c5bbd14b8f4ad7f

Observation 57eb0acc-3729-440d-a86f-1b47bebfb776 · outbound

This paper cites U- Net: Convolutional networks for biomedical image segmen- tation.

Language-Guided Image Tokenization for Generation U- Net: Convolutional networks for biomedical image segmen- tation

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-11T20:24:57.014752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:24:57.014752Z digest=sha256:458fcdb09d1135f1c11e57be4529cc20ed48c75b29463553ec1e526fd003f0d2

Observation 1761076b-9b92-402e-becb-cd69313446d3 · outbound

This paper cites Improved techniques for training gans.

Language-Guided Image Tokenization for Generation Improved techniques for training gans

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.233670Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:57.018090Z digest=sha256:cfb1cd5a362c832aa2a99f335950628c1c9d4ac3b1da109a0474534900ee1997

Observation 4e41d88f-cac5-43f2-9fb4-f50ea70b3b44 · outbound

This paper cites StyleGAN- XL: Scaling StyleGAN to large diverse datasets.

Language-Guided Image Tokenization for Generation StyleGAN- XL: Scaling StyleGAN to large diverse datasets

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.223509Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:57.021362Z digest=sha256:8b40aec4df2af021e2cbe1b31659fc9ec4899a524023d6d3cb3ebb459433be23

Observation e4dce93b-c953-4fe5-84fc-9d85a86d7cc8 · outbound

This paper cites Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation.

Language-Guided Image Tokenization for Generation Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-11T20:24:57.024663Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:24:57.024663Z digest=sha256:a987814381a88f71e42cb9e0da7a8b07424dadf0c716ed2b74a0d7950ceed3c1

Observation 1e6e3b14-f96e-4d9e-839d-cef3c5a2dc12 · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

Language-Guided Image Tokenization for Generation Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-11T20:24:57.028163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:24:57.028163Z digest=sha256:3aafb71514807b1ef0874a88260747f770e78cb56df086e1cb08f9d20f71b071

Observation a20cf717-b25b-4da8-90c2-c1a549f6348a · outbound

This paper cites Visual autoregressive modeling: Scalable image generation via next-scale prediction.

Language-Guided Image Tokenization for Generation Visual autoregressive modeling: Scalable image generation via next-scale prediction

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.213387Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:57.031484Z digest=sha256:c6a6c0c6f1b3792809c2a960eb483c9a22cc2f1f7d2d6c275ed28bbec9899ac6

Observation e1a34338-c8a4-4765-b581-53810896b34a · outbound

This paper cites Regularizing generative adversarial networks under limited data.

Language-Guided Image Tokenization for Generation Regularizing generative adversarial networks under limited data

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-11T20:24:57.034868Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:24:57.034868Z digest=sha256:d047fa39bd8d693d6c2bed0431db51a4145ee62d36d473b960401cf797f54744

Observation 8d5044ec-fe3c-47ad-a601-348b82e8ea4a · outbound

This paper cites Neural discrete representation learning.

Language-Guided Image Tokenization for Generation Neural discrete representation learning

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.197174Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:57.038027Z digest=sha256:82fce3ead8bd199fb118ccc78f12f5aba5d4f5a0c6a7539b7da77c4e980e6817

Observation 5099704f-ed3f-4654-acb1-4e4aa310bb2a · outbound

This paper cites MaskBit: Embedding-free Image Generation via Bit Tokens.

Language-Guided Image Tokenization for Generation MaskBit: Embedding-free Image Generation via Bit Tokens

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-11T20:24:57.041491Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:24:57.041491Z digest=sha256:2e25a7d7319b560ef6e42345558198902b67b61b24c40852f08cd13ae51ac5d2

Observation b2b7d0df-448e-4408-b7ce-0f6dcb813986 · outbound

This paper cites Vector-quantized Image Modeling with Improved VQGAN.

Language-Guided Image Tokenization for Generation Vector-quantized Image Modeling with Improved VQGAN

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-11T20:24:57.044985Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:24:57.044985Z digest=sha256:96142ee7b67412dad19648534629618686be7ddcbe4cfa56ebafcb55d2e1ab34

Observation 9721683b-e78d-4cad-a8fe-835a8255d6cf · outbound

This paper cites SPAE: Semantic pyramid autoencoder for multimodal generation with frozen llms.

Language-Guided Image Tokenization for Generation SPAE: Semantic pyramid autoencoder for multimodal generation with frozen llms

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.187065Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:57.048562Z digest=sha256:6dee3ee74a6f9bdba89d9ec8237e4a2791c178a9632fdc52f7d95a78bfffa304

Observation 1afd221e-fd75-4741-a70d-463612235bf5 · outbound

This paper cites Language model beats diffusion - tokenizer is key to visual generation.

Language-Guided Image Tokenization for Generation Language model beats diffusion - tokenizer is key to visual generation

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.176839Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:57.051676Z digest=sha256:8e5775def439932adb66e1566d529817a6104adab9a9fdb4ddc45a27fe11edd7

Observation b135a9bf-5eba-407f-beaf-10a2d1647d24 · outbound

This paper cites An image is worth 32 tokens for reconstruction and generation.

Language-Guided Image Tokenization for Generation An image is worth 32 tokens for reconstruction and generation

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-11T20:24:57.054832Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:24:57.054832Z digest=sha256:81841a8dae27fd6b32c1134f71bffa2afecf42f4956a211679cca2b220b2eaab

Observation 20a48857-ce16-4e7c-a4d5-3f7380187911 · outbound

This paper cites Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think.

Language-Guided Image Tokenization for Generation Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-11T20:24:57.058226Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:24:57.058226Z digest=sha256:5c422e0afc3cce52a3274ffe039b1e486f4e119acea37ad3886f818ef6e2a324

Observation 05383c79-2600-41b5-b2f8-273221986c61 · outbound

This paper cites The unreasonable effectiveness of deep features as a perceptual metric.

Language-Guided Image Tokenization for Generation The unreasonable effectiveness of deep features as a perceptual metric

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.160987Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:57.062177Z digest=sha256:ada560841ea28d455a7a263315a37fb1f2c1ef1d5d3a2e52158aa1a556bf35a2

Observation dc91bc82-b53b-4189-a857-447d88cbec78 · outbound

This paper cites Beyond text: Frozen large language models in visual signal comprehension.

Language-Guided Image Tokenization for Generation Beyond text: Frozen large language models in visual signal comprehension

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:24:57.150842Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:24:57.065394Z digest=sha256:1bb563ea4094df3730e24e79d79a52b517a10ccf2ddf8845820dc954e3f5aed8

Pith citing papers

Observation 0d66c76c-b80a-4704-9620-331ddc35365a · inbound

Multimodal Medical Code Tokenizer cites this paper.

Multimodal Medical Code Tokenizer Language-Guided Image Tokenization for Generation

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-09T00:42:57.247608Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T00:42:57.247608Z digest=sha256:6bab365420f340c53eb9c8f86c7f29f209f37762ac482ccd0e12b43f2109ab91

Observation 83634214-c9ac-405e-bda6-a9801779ecc6 · inbound

UniVLA: Learning to Act Anywhere with Task-centric Latent Actions cites this paper.

UniVLA: Learning to Act Anywhere with Task-centric Latent Actions Language-Guided Image Tokenization for Generation

Reference 89

Resolution
verified exact
arxiv_id, observed 2026-05-12T15:28:06.946533Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-12T15:28:06.883492Z digest=sha256:b15f526526dc07fa8cdf93924c9564b9b9b7bf779124d6886b3fb443d2051f7c

Observation e546a40c-e404-4c84-ba5e-26b9856e6e0c · inbound

TurboVSR: Fantastic Video Upscalers and Where to Find Them cites this paper.

TurboVSR: Fantastic Video Upscalers and Where to Find Them Language-Guided Image Tokenization for Generation

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-06T21:41:37.924047Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:41:37.924047Z digest=sha256:113ce910c768009d056e816d01206862e67645ec1aaf39284e19e713f14cdbe4

Observation 04a282f2-e224-4651-b17e-bd2a670c7af5 · inbound

DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer cites this paper.

DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer Language-Guided Image Tokenization for Generation

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-06T19:41:23.825012Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:41:23.825012Z digest=sha256:e5924aafb61ba4b7e3d2721ddd80c8f98393106494f1ac44c382b000ba8980d3

Observation 0c9202b4-2b94-46cf-9afa-3644f515aa8c · inbound

DiffusionBench: On Holistic Evaluation of Diffusion Transformers cites this paper.

DiffusionBench: On Holistic Evaluation of Diffusion Transformers Language-Guided Image Tokenization for Generation

Reference 36

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T16:59:58.165169Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-26T00:06:11.951205Z digest=sha256:947a88b4e7b0417350b04ecb20dca8abfa407a2b8b0cca96bdad48ef2626f41a