Pith. sign in

Paper Citation Record · LEDGER

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation

As of 17 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 2 inbound Pith citation observations for arXiv:2505.13439.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.13439 v1

Coverage vector

measured 55 of 55 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T20:16:36.724968Z

measured 57 of 57 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-16T06:30:59.297886+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-11T00:27:00.510598Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-15T02:13:30.560857Z

Reference resolution

55 of 55 outbound references displayed

  • verified exact0
  • verified fuzzy24
  • unresolved31
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation db410918-91ed-498b-880d-92c47a057137 · outbound

This paper cites Ntire 2017 challenge on single image super-resolution: Dataset and study.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Ntire 2017 challenge on single image super-resolution: Dataset and study

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:38.283097Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.300834Z digest=sha256:0472311ca6c1b8f57fc684c74320beb5d2a8de85ff0b73356e6e15a2f45d7e43

Observation 8904b23b-cdc1-4eb4-896f-f34b4f875235 · outbound

This paper cites Clifton, Yuxiong He, Dacheng Tao, and Shuaiwen Leon Song.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Clifton, Yuxiong He, Dacheng Tao, and Shuaiwen Leon Song

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:38.261068Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.312359Z digest=sha256:81c4d917b9d65481d8b04716c8c4f5a90db470450cad7fbe15aed4ed99658966

Observation 26325fd5-f7da-4ff6-990e-c4bb15145517 · outbound

This paper cites an unresolved cited work.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:16:38.232363Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.319246Z digest=sha256:3270d24bc2c5dfed49e2fff68f8f78bfb2e3599ba9dcf5d4dd139d0400d41018

Observation fb59921e-e5ca-4b5d-8f23-a7fac145d4f2 · outbound

This paper cites Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.342757Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.342757Z digest=sha256:ba07abce455394372645a9404ba0f1c01ffab26d4ef01dea33e89ac22984e23b

Observation a5b652ff-d965-4adf-988f-0bda4ea9a5a2 · outbound

This paper cites ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.354700Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.354700Z digest=sha256:f5bc074f7cc5b026b6d8d663c8a78623337461eb6c72807e912574d61f193d8d

Observation b4eb62af-8856-46b6-93e7-991a6bca1028 · outbound

This paper cites Diffusion models in vision: A survey.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Diffusion models in vision: A survey

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:38.214092Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.364010Z digest=sha256:c3a053d25de98ae2145689fbcadaf874301208315661230610725f48d0824924

Observation 538b30ab-20d2-416e-99bd-ef3bb6787e56 · outbound

This paper cites DeepSeek-V3 Technical Report.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation DeepSeek-V3 Technical Report

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.370349Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.370349Z digest=sha256:2445181f227d0d058feac255107c3bf2d35fb62e4a510005f2a3c6b6c3835e89

Observation 70d69441-ae04-4793-988e-ca469d293cab · outbound

This paper cites Taming transformers for high-resolution image synthesis.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Taming transformers for high-resolution image synthesis

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:38.184099Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.377341Z digest=sha256:cd6eec3cbefeab08fdb15df1f89601abead9cb297db8f736bd3a973c5a98c5b8

Observation f45c5ba9-0e6c-4fb9-8f9e-859ad9aad8af · outbound

This paper cites Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.384466Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.384466Z digest=sha256:5216daa29f83c464b250587dea854f26c63c52fd91e56554a9ee9cc07e48fb0a

Observation 1b0cb649-3dc8-4e6e-87d6-6df936d3e7e7 · outbound

This paper cites Unified Autoregressive Visual Generation and Understanding with Continuous Tokens.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Unified Autoregressive Visual Generation and Understanding with Continuous Tokens

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.394421Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.394421Z digest=sha256:4601e25767ec0863e7cd0853e17bc8ea0ba77c3dec9a9c8c35d7540305b4ae85

Observation e7820c31-5e22-45cb-a92c-e411abf5de04 · outbound

This paper cites SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.401027Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.401027Z digest=sha256:b566c18ff41395722c59abe0d080519fff118899b4c547ad3540ef94488e4ca3

Observation affc3f69-1212-4306-b807-b4b73f4a4a68 · outbound

This paper cites Geneval: An object-focused frame- work for evaluating text-to-image alignment.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Geneval: An object-focused frame- work for evaluating text-to-image alignment

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:38.163394Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.409214Z digest=sha256:75beb33b7387bdf51a93d410556cc48b81b4fbc2aa59b5afc5d73671a5f60ba4

Observation 702514c5-fc94-4f91-a9ab-61fe4b3adfe7 · outbound

This paper cites Infinity: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image Synthesis.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Infinity: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image Synthesis

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.417004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.417004Z digest=sha256:526f2d768212456d651402e7013c97da31b529bca88964ab4be7bfe6173fe91b

Observation d9cbcffc-f756-45e3-ac1b-ea60dcd642a6 · outbound

This paper cites Denoising diffusion probabilistic models.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Denoising diffusion probabilistic models

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:38.127803Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.422755Z digest=sha256:e6ab52b3edf862d239f0b29bb21a1ed51223e33ea44bb8df0c580b629ebea3ab

Observation e8d033b2-051f-4aca-9fb9-ed536b844fdd · outbound

This paper cites T2i-compbench: A compre- hensive benchmark for open-world compositional text-to-image generation.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation T2i-compbench: A compre- hensive benchmark for open-world compositional text-to-image generation

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:38.091876Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.428618Z digest=sha256:6f0cd1aebad1be97ecded910c5b622d7b86b0b7d7d1608b9fd2cb4f636d46be8

Observation e6337c26-64a4-4e4d-8f0a-52d9de4633a1 · outbound

This paper cites T2i- compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation T2i- compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:38.070585Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.433188Z digest=sha256:1ee367b777d506a7157261d4ae10ededfa1e16208759ab14abb5a14aa38cffad

Observation b6ea2a2f-7d13-4495-917d-5352094c9e3a · outbound

This paper cites Mixtral of Experts.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Mixtral of Experts

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.437691Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.437691Z digest=sha256:63f44464ddd4f84ad56acc46a57f48a617eeead03980e440ee8bf814fa229677

Observation 617f1c81-8d5e-422f-81ca-1804817f5d68 · outbound

This paper cites Gemma 3 Technical Report.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Gemma 3 Technical Report

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.443765Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.443765Z digest=sha256:974553d6f2fdfbc6087866df810afcf85dcb3020d35b0bf3a7359fa92ec0f6be

Observation ce6db9e8-273a-42be-8483-3aa33e23bce9 · outbound

This paper cites an unresolved cited work.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.452476Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.452476Z digest=sha256:b0340c0cfc6720559479a5efc6f6147afb177ed6ed57e0efd1d81ed7ebfe5743

Observation 3dca018f-35e6-4697-80dd-f60765f49149 · outbound

This paper cites Have we unified image generation and understanding yet? An empirical study of GPT-4o's image generation ability.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Have we unified image generation and understanding yet? An empirical study of GPT-4o's image generation ability

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.458745Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.458745Z digest=sha256:8c9942c3113b104a2f3845a86a69538e7c1b44f62ea8117d29db0698a2051e01

Observation a1b5da0e-e809-4a95-810e-2af0c068cc6b · outbound

This paper cites Autoregressive image generation without vector quantization.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Autoregressive image generation without vector quantization

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:38.038928Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.466766Z digest=sha256:02ec7e57458fe240b05fa9fd13ec76247f30e1ff86883ab1881efb63aa4ea404

Observation 135a407e-4e75-4019-902a-a41f79aba2e2 · outbound

This paper cites DMin: Scalable Training Data Influence Estimation for Diffusion Models.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation DMin: Scalable Training Data Influence Estimation for Diffusion Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.473362Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.473362Z digest=sha256:13bd16d7b7cf74f91182d0f40a63b80dbcb68fc2904aa82c750c582015d64524

Observation ea3a709d-62b7-4745-b640-8c06eef6a010 · outbound

This paper cites Token-wise influential training data retrieval for large language models.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Token-wise influential training data retrieval for large language models

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:38.019293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.480095Z digest=sha256:019b1830f1f509a342e5388210ea595bf8cd8bd8945e69d048a52c94cd48ebb5

Observation f1ab93dd-d49d-4ce0-89b6-a50182fb56cf · outbound

This paper cites UniGuardian: A Unified Defense for Detecting Prompt Injection, Backdoor Attacks and Adversarial Attacks in Large Language Models.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation UniGuardian: A Unified Defense for Detecting Prompt Injection, Backdoor Attacks and Adversarial Attacks in Large Language Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.487502Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.487502Z digest=sha256:03f0189309f0840dfc90baa7971d89ff75bdca029c550a65ac1030b41c35dc06

Observation 05103f85-38f4-4ae8-ac6c-8141a6e11884 · outbound

This paper cites Unified-io 2: Scaling autoregressive multimodal models with vision, language, audio, and action.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Unified-io 2: Scaling autoregressive multimodal models with vision, language, audio, and action

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:37.994942Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.493103Z digest=sha256:6b0a115bb97425439b4a9c6ab5abd7cc216c8bfd15b3b4ce9889f50a632b89bf

Observation 5d2824b9-b490-4ea5-9cd5-26d9bd75015a · outbound

This paper cites Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.500770Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.500770Z digest=sha256:c10ddbeb1c0c7fbc0764f53b98c3dde5bc0ba99a61713be541a354fce0130ead

Observation f83de64b-06dd-478d-bd12-388f9ba8b9ae · outbound

This paper cites Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.507549Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.507549Z digest=sha256:7d31d52a9608c5577373978d02436cea92e9223bf7d4579bf40e766ad90c1ada

Observation d13a32ad-66c6-4e74-a2c8-081202648097 · outbound

This paper cites Blaschko, Guohao Dai, Huazhong Yang, and Yu Wang.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Blaschko, Guohao Dai, Huazhong Yang, and Yu Wang

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:37.971465Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.513880Z digest=sha256:be775004d15ea1e58ec2dcd61f6569f3ee2b8e0ff9431fd2971049d6bfa05efd

Observation b30d8c8b-1591-4933-95b9-e2207f1105d7 · outbound

This paper cites Introducing 4o image generation, 2025.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Introducing 4o image generation, 2025

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.524284Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.524284Z digest=sha256:bb433610b0bd83bb3a31a0c1c85550c92879ecd0a2f793d3ea8515d62f794196

Observation 9967247f-93ea-4f43-9020-89cb3ac4482b · outbound

This paper cites ALinFiK: Learning to Approximate Linearized Future Influence Kernel for Scalable Third-Party LLM Data Valuation.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation ALinFiK: Learning to Approximate Linearized Future Influence Kernel for Scalable Third-Party LLM Data Valuation

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.531312Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.531312Z digest=sha256:2e5c42956be3095a14d99ea20f58b3121e9ba363ffca6b38d51b927c51b57b01

Observation 5ee96cbb-b416-476c-9567-5bb9f58cc224 · outbound

This paper cites Scalable diffusion models with transformers.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Scalable diffusion models with transformers

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:37.929121Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.536456Z digest=sha256:8f10a944ae325850d0dc05efbeb62f2dcc1d58d60f51920bc05307be2fe465a0

Observation 8279ae23-be39-4867-b902-05795387f8f3 · outbound

This paper cites Reasoning with large language models, a survey.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Reasoning with large language models, a survey

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.542561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.542561Z digest=sha256:b357de31d05fff3f0d140c18719294ad44fa31cc2a3267245c466b99d274ba32

Observation a677e66f-0014-4f3e-aaaf-a910fedb4a03 · outbound

This paper cites High-Resolution Image Synthesis with Latent Diffusion Models.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation High-Resolution Image Synthesis with Latent Diffusion Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.548934Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.548934Z digest=sha256:f5bb23ca187a7d829fdb0e0d4d485b0123dbafc2316fbbbc985a8318b322a1aa

Observation f678be5b-2c8b-47f3-a3c0-6b5e9c09c1c8 · outbound

This paper cites High- resolution image synthesis with latent diffusion models.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation High- resolution image synthesis with latent diffusion models

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:37.902423Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.557363Z digest=sha256:392aff32e892e883d1c4c99ebe9fb2459aabb0f1ef4b7df8792ec708a02177fb

Observation dcccecc1-3ad7-4d4c-becb-eac94a414194 · outbound

This paper cites Bernstein, Alexander C.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Bernstein, Alexander C

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:37.878116Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.563815Z digest=sha256:c473d874b7956597713ad0339891f1b748f84998799d57ba8f032a7e0c93cee1

Observation 075afcea-125e-4910-ac84-9813d4aa96c9 · outbound

This paper cites Flow to the mode: Mode- seeking diffusion autoencoders for state-of-the-art image tokenization.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Flow to the mode: Mode- seeking diffusion autoencoders for state-of-the-art image tokenization

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.570432Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.570432Z digest=sha256:5f4a778770aeaa58d65bf184be39804b3ca21099ed130038e67555fe1a6c0c85

Observation dedf71b8-daa2-4b2b-b43b-7ae23469a3f9 · outbound

This paper cites Drivelm: Driving with graph visual question answering.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Drivelm: Driving with graph visual question answering

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:37.857053Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.580593Z digest=sha256:3ba88d082874e80ac744e8629c69e0c21eb3e0237520fbad6d708bc23411d3ea

Observation 71b0f393-a913-400e-854b-6d81b7579d0c · outbound

This paper cites Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.588401Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.588401Z digest=sha256:bbfa916df5e6a5ef0fe798822df793727596f0cd5f82b125f09a7abaeff345fa

Observation a23b861a-d57b-4505-9476-2a0a2abbb635 · outbound

This paper cites Chameleon: Mixed-Modal Early-Fusion Foundation Models.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Chameleon: Mixed-Modal Early-Fusion Foundation Models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.594006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.594006Z digest=sha256:17fa9a948926ad870a09fbd49ebb3e52ec3ba7d646c6a7853dbd65083fdc6703

Observation 75d46c6d-b531-4021-8991-219e7328869e · outbound

This paper cites Visual autoregressive modeling: Scalable image generation via next-scale prediction.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Visual autoregressive modeling: Scalable image generation via next-scale prediction

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:37.836930Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.608247Z digest=sha256:b3d5bb1a8158596621726abe7bc1a752174cdf37d62d45dcaf427101a782bb36

Observation dd99bfe0-6c01-4926-90c7-7c4efe76a536 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation LLaMA: Open and Efficient Foundation Language Models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.614723Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.614723Z digest=sha256:a5fc49bb7bd6b83e3176f84331ffb7810fe8cf4d9586bd00f7ac25726925bef1

Observation 7d22ed68-bec4-4b7a-a314-a11af275c057 · outbound

This paper cites Neural discrete representation learning.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Neural discrete representation learning

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:37.807855Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.622958Z digest=sha256:4d81f3b58989c74c4f116b45c4f40706e9ee2671b42705685619ef67ed936b7d

Observation ce548559-a3d4-4656-aa8f-3527fdad1767 · outbound

This paper cites What Makes for Good Visual Tokenizers for Large Language Models?.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation What Makes for Good Visual Tokenizers for Large Language Models?

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.633448Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.633448Z digest=sha256:6694672044e75b2afced3cf7025efb1b30c592d3bad0f8f8dc0ecf1e71d4d26c

Observation 29281ab3-185d-4244-a02c-96e4c07fcc0d · outbound

This paper cites MaskBit: Embedding-free Image Generation via Bit Tokens.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation MaskBit: Embedding-free Image Generation via Bit Tokens

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.642689Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.642689Z digest=sha256:10e2e8731300918fd87da905ca8ebd58112267439a7004639d949f7a4c1b1067

Observation 9cf2c012-4a29-4f47-b383-f2762e1cc16e · outbound

This paper cites Liquid: Language Models are Scalable and Unified Multi-modal Generators.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Liquid: Language Models are Scalable and Unified Multi-modal Generators

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.649273Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.649273Z digest=sha256:5cbad25c11209fecdae7de6ce18fae6a3586c2e088bf6b1d19784fd106e340d7

Observation 340e14b2-33d6-4a46-861e-ad764a3fbe8a · outbound

This paper cites VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.655133Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.655133Z digest=sha256:3501181d6b7292cf912887ccc9924686c5cc46e5a663b4b1e5734b4e72503c91

Observation 30cfff84-9fc7-4114-af0a-bfae6c15be7e · outbound

This paper cites Show-o: One Single Transformer to Unify Multimodal Understanding and Generation.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Show-o: One Single Transformer to Unify Multimodal Understanding and Generation

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.662678Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.662678Z digest=sha256:a4c119e0e5b56bf2ac9507a3b47bbdc302953e735eafcf7cdfb785213f9df3c2

Observation 76efe441-a51c-424d-bced-dc848b720fc6 · outbound

This paper cites GPT-ImgEval: A Comprehensive Benchmark for Diagnosing GPT4o in Image Generation.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation GPT-ImgEval: A Comprehensive Benchmark for Diagnosing GPT4o in Image Generation

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.676564Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.676564Z digest=sha256:5e6f82e4da0df52b09a086f7f139ebf417c5139b06e3225d08fef0968a51c73c

Observation 8c692157-d8d9-4124-9191-adb6d8deaf03 · outbound

This paper cites Diffusion models: A comprehensive survey of methods and applications.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Diffusion models: A comprehensive survey of methods and applications

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:37.780887Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.685791Z digest=sha256:36cf70ce5c1f210d41c1559ea4834ee9bc5f7ef8bbd4ac79479cfca71a54b627

Observation c372fb36-84b4-4a74-b57a-07ccf93ae185 · outbound

This paper cites Hauptmann, Ming-Hsuan Yang, Yuan Hao, Irfan Essa, and Lu Jiang.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Hauptmann, Ming-Hsuan Yang, Yuan Hao, Irfan Essa, and Lu Jiang

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:37.759971Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.692217Z digest=sha256:d1c4a198ac1224829a9481d1467e159b209a93d5a53712d7c05d71f62beb2644

Observation be95616b-2bdc-4a0d-a803-151685542525 · outbound

This paper cites Hauptmann, Boqing Gong, Ming-Hsuan Yang, Irfan Essa, David A.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Hauptmann, Boqing Gong, Ming-Hsuan Yang, Irfan Essa, David A

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:37.740883Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.697988Z digest=sha256:51cd908259c6d0e60af2310045c6eaf5a86749f12e64fdde4cbbe919c1637c68

Observation 69feac44-94b4-4641-be7f-0ce8ed4c4eb2 · outbound

This paper cites An image is worth 32 tokens for reconstruction and generation.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation An image is worth 32 tokens for reconstruction and generation

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:37.715747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.704093Z digest=sha256:8cd78529a54c6cc3ec4281e463e0b1a35dd5a6f249211eec4a4735834a743caa

Observation 16d4eb7e-1952-43e1-8c7b-b7807d352c6f · outbound

This paper cites A simple LLM framework for long-range video question-answering.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation A simple LLM framework for long-range video question-answering

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:37.684490Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.711866Z digest=sha256:7d340b8ae939b81caf3c62d9086ecfb3b3c0fae8a0cff3fb1a347d424db3740c

Observation 5c3081dc-376c-4be7-b953-4568a12883b7 · outbound

This paper cites Efros, Eli Shechtman, and Oliver Wang.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Efros, Eli Shechtman, and Oliver Wang

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:16:37.656742Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:16:36.718820Z digest=sha256:7a4903e0b50c327be20dbbce67045db33b901c4c15b3c4c3f51cc30fba857e0f

Observation 51f42578-6c45-4910-a670-8fdc1494ba87 · outbound

This paper cites Image and Video Tokenization with Binary Spherical Quantization.

VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation Image and Video Tokenization with Binary Spherical Quantization

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-15T20:16:36.724968Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:16:36.724968Z digest=sha256:919f1dbcfcdaddc90f69bb158aa90246d61b3a17ec15c69839ca85503348a5ad

Pith citing papers

Observation f64afaca-72dc-4b45-a466-fe99c0a4e46a · inbound

InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation cites this paper.

InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-15T02:13:30.562810Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-05-15T02:10:18.004724Z digest=sha256:5684ff2dce315498dc394b7ce22d17b3236242f5d4c5683e35d98e95d07a2504

Observation 21b780be-50b9-42c5-a4de-f83e7427bed3 · inbound

Tokenizer Generator Coupling in Medical Image Generation cites this paper.

Tokenizer Generator Coupling in Medical Image Generation VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T00:27:00.510598Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:27:00.510598Z digest=sha256:1d1eb0feac15b5b7b882f0ef62652a7c6629d52f949260f4b9bfc1ccc9a7a781