{"as_of":"2026-08-17T07:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:235a35aaa984be2c5dc4ffdb20cd2c0b311a98d9d372b65fc20c41cc5baf29f7","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:16:36.724968Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:27:00.510598Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T02:13:30.560857Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"cited_work":{"arxiv_id":"2505.13439","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13439","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vtbench: Evaluating visual tokenizers for autoregressive image generation","venue":null,"work_id":"231a90ad-7a82-4be9-a1d2-db271132526e","year":2025},"citing_paper":{"arxiv_id":"2605.14333","last_updated":"2026-05-14T03:57:25Z","snapshot_observed_at":"2026-08-02T04:28:22.039399Z","submitted_at":"2026-05-14T03:57:25Z","title":"InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T02:10:18.004724Z"},"links":{"cited_paper":"/paper/2505.13439","citing_paper":"/paper/2605.14333"},"observation_digest":"sha256:bf8f977a7802fcdbf3898c2304755a5128c3eb426e73284dfb759074d2818120","observation_id":"f64afaca-72dc-4b45-a466-fe99c0a4e46a","resolution":{"observed_at":"2026-05-15T02:13:30.562810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13439","snapshot_observed_at":"2026-08-11T00:27:00.510598Z","title":"VTBench: Evaluating visual tokenizers for autoregressive image generation.arXiv preprint arXiv:2505.13439,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07713","last_updated":"2026-08-07T18:57:09Z","snapshot_observed_at":"2026-08-14T05:09:56.150946Z","submitted_at":"2026-08-07T18:57:09Z","title":"Tokenizer Generator Coupling in Medical Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T00:27:00.510598Z"},"links":{"cited_paper":"/paper/2505.13439","citing_paper":"/paper/2608.07713"},"observation_digest":"sha256:1d1eb0feac15b5b7b882f0ef62652a7c6629d52f949260f4b9bfc1ccc9a7a781","observation_id":"21b780be-50b9-42c5-a4de-f83e7427bed3","resolution":{"observed_at":"2026-08-11T00:27:00.510598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13439/citation-record","integrity":"/paper/2505.13439/integrity","json":"/paper/2505.13439/citation-record.json","paper":"/paper/2505.13439"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:38.276486Z","title":"Ntire 2017 challenge on single image super-resolution: Dataset and study","venue":null,"work_id":"b1e8096d-7410-4381-aeec-e19cb934b5f0","year":2017},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.300834Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:fdbacd20908d06aa84e1b53a410254c288cc7fe3d0162b293e346670435aa375","observation_id":"db410918-91ed-498b-880d-92c47a057137","resolution":{"observed_at":"2026-08-15T20:16:38.283097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:38.254037Z","title":"Clifton, Yuxiong He, Dacheng Tao, and Shuaiwen Leon Song","venue":null,"work_id":"0c538aab-7e1b-4037-bad8-a98dcd468b0d","year":2025},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.312359Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:11c44cc493ea98226bb12160ad157b543085ea17dfa17e8c80f8da1b1dae2f94","observation_id":"8904b23b-cdc1-4eb4-896f-f34b4f875235","resolution":{"observed_at":"2026-08-15T20:16:38.261068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:38.227126Z","title":null,"venue":null,"work_id":"d05283c7-e158-4b07-9691-0cb8d000cd62","year":2022},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.319246Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:41e9cabc35c3f0a03578195de1b08277f65a79e066ae78e013cf1a7e08355259","observation_id":"26325fd5-f7da-4ff6-990e-c4bb15145517","resolution":{"observed_at":"2026-08-15T20:16:38.232363Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-15T20:16:36.342757Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.342757Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:ba07abce455394372645a9404ba0f1c01ffab26d4ef01dea33e89ac22984e23b","observation_id":"fb59921e-e5ca-4b5d-8f23-a7fac145d4f2","resolution":{"observed_at":"2026-08-15T20:16:36.342757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06135","last_updated":"2024-07-08T17:08:02Z","snapshot_observed_at":"2026-08-16T13:36:04.501646Z","submitted_at":"2024-07-08T17:08:02Z","title":"ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06135","snapshot_observed_at":"2026-08-15T20:16:36.354700Z","title":"ANOLE: an open, autoregressive, native large multimodal models for interleaved image-text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.354700Z"},"links":{"cited_paper":"/paper/2407.06135","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:f5bc074f7cc5b026b6d8d663c8a78623337461eb6c72807e912574d61f193d8d","observation_id":"a5b652ff-d965-4adf-988f-0bda4ea9a5a2","resolution":{"observed_at":"2026-08-15T20:16:36.354700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:38.206061Z","title":"Diffusion models in vision: A survey","venue":null,"work_id":"0509207a-851a-4647-a744-1c9914e02fc1","year":2023},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.364010Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:4cabf8e16c0d7998d392841bbdd4244a00fbfb7c3b7da2faf4aad8f86f03b4c8","observation_id":"b4eb62af-8856-46b6-93e7-991a6bca1028","resolution":{"observed_at":"2026-08-15T20:16:38.214092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T20:16:36.370349Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.370349Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:2445181f227d0d058feac255107c3bf2d35fb62e4a510005f2a3c6b6c3835e89","observation_id":"538b30ab-20d2-416e-99bd-ef3bb6787e56","resolution":{"observed_at":"2026-08-15T20:16:36.370349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:38.177694Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"f90da339-9408-4899-8826-f334347a89a1","year":2021},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.377341Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:653cfacc11edc85a7622e87f45efc2e79f92ed24021e0cf84bc4112377ce0b5a","observation_id":"70d69441-ae04-4793-988e-ca469d293cab","resolution":{"observed_at":"2026-08-15T20:16:38.184099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13863","last_updated":"2024-10-17T17:59:59Z","snapshot_observed_at":"2026-08-16T13:08:17.144750Z","submitted_at":"2024-10-17T17:59:59Z","title":"Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13863","snapshot_observed_at":"2026-08-15T20:16:36.384466Z","title":"Fluid: Scaling autoregressive text-to-image generative models with continuous tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.384466Z"},"links":{"cited_paper":"/paper/2410.13863","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:5216daa29f83c464b250587dea854f26c63c52fd91e56554a9ee9cc07e48fb0a","observation_id":"f45c5ba9-0e6c-4fb9-8f9e-859ad9aad8af","resolution":{"observed_at":"2026-08-15T20:16:36.384466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13436","last_updated":"2025-03-17T17:58:30Z","snapshot_observed_at":"2026-08-16T12:49:15.429075Z","submitted_at":"2025-03-17T17:58:30Z","title":"Unified Autoregressive Visual Generation and Understanding with Continuous Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13436","snapshot_observed_at":"2026-08-15T20:16:36.394421Z","title":"Unified autoregressive visual generation and understanding with continuous tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.394421Z"},"links":{"cited_paper":"/paper/2503.13436","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:4601e25767ec0863e7cd0853e17bc8ea0ba77c3dec9a9c8c35d7540305b4ae85","observation_id":"1b0cb649-3dc8-4e6e-87d6-6df936d3e7e7","resolution":{"observed_at":"2026-08-15T20:16:36.394421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-15T20:16:36.401027Z","title":"SEED-X: multimodal models with unified multi-granularity comprehension and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.401027Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:b566c18ff41395722c59abe0d080519fff118899b4c547ad3540ef94488e4ca3","observation_id":"e7820c31-5e22-45cb-a92c-e411abf5de04","resolution":{"observed_at":"2026-08-15T20:16:36.401027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:38.144261Z","title":"Geneval: An object-focused frame- work for evaluating text-to-image alignment","venue":null,"work_id":"14aabda8-1e5e-456f-8a75-0a4e6eab7f4a","year":2023},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.409214Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:03d00d8c15cf408f44ef554e402eca5f5d17aab6c109d9b99b34e05a77fc1c4e","observation_id":"affc3f69-1212-4306-b807-b4b73f4a4a68","resolution":{"observed_at":"2026-08-15T20:16:38.163394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04431","last_updated":"2025-06-17T15:32:20Z","snapshot_observed_at":"2026-08-15T00:31:45.808844Z","submitted_at":"2024-12-05T18:53:02Z","title":"Infinity: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04431","snapshot_observed_at":"2026-08-15T20:16:36.417004Z","title":"Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.417004Z"},"links":{"cited_paper":"/paper/2412.04431","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:526f2d768212456d651402e7013c97da31b529bca88964ab4be7bfe6173fe91b","observation_id":"702514c5-fc94-4f91-a9ab-61fe4b3adfe7","resolution":{"observed_at":"2026-08-15T20:16:36.417004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:38.116949Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"22cf1a38-dd93-41c6-8832-c76644369d7a","year":2020},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.422755Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:ff2d8b4326435fddbb6ca69474b6b1ba860b349c749cab42df447674d45245a8","observation_id":"d9cbcffc-f756-45e3-ac1b-ea60dcd642a6","resolution":{"observed_at":"2026-08-15T20:16:38.127803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:38.084479Z","title":"T2i-compbench: A compre- hensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":"bef2c0ea-e93f-42a5-b904-2e183a0c4a84","year":2023},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.428618Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:a465df420cc14c44756502344aa4a60d0834d1b0224bf6b0c4f04cfcc90e1be0","observation_id":"e8d033b2-051f-4aca-9fb9-ed536b844fdd","resolution":{"observed_at":"2026-08-15T20:16:38.091876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:38.064872Z","title":"T2i- compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation","venue":null,"work_id":"5096dd4e-b5f5-4440-b9d5-3b774b121530","year":2025},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.433188Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:9a3e9049791adef2893e5761948ec975a29c2189b2711319d051faff7fe87935","observation_id":"e6337c26-64a4-4e4d-8f0a-52d9de4633a1","resolution":{"observed_at":"2026-08-15T20:16:38.070585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-15T20:16:36.437691Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.437691Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:63f44464ddd4f84ad56acc46a57f48a617eeead03980e440ee8bf814fa229677","observation_id":"b6ea2a2f-7d13-4495-917d-5352094c9e3a","resolution":{"observed_at":"2026-08-15T20:16:36.437691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-15T20:16:36.443765Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.443765Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:974553d6f2fdfbc6087866df810afcf85dcb3020d35b0bf3a7359fa92ec0f6be","observation_id":"617f1c81-8d5e-422f-81ca-1804817f5d68","resolution":{"observed_at":"2026-08-15T20:16:36.443765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:36.452476Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.452476Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:b0340c0cfc6720559479a5efc6f6147afb177ed6ed57e0efd1d81ed7ebfe5743","observation_id":"ce6db9e8-273a-42be-8483-3aa33e23bce9","resolution":{"observed_at":"2026-08-15T20:16:36.452476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08003","last_updated":"2025-04-09T16:10:15Z","snapshot_observed_at":"2026-08-16T12:42:39.095400Z","submitted_at":"2025-04-09T16:10:15Z","title":"Have we unified image generation and understanding yet? An empirical study of GPT-4o's image generation ability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08003","snapshot_observed_at":"2026-08-15T20:16:36.458745Z","title":"Have we unified image generation and understanding yet? an empirical study of gpt-4o’s image generation ability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.458745Z"},"links":{"cited_paper":"/paper/2504.08003","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:8c9942c3113b104a2f3845a86a69538e7c1b44f62ea8117d29db0698a2051e01","observation_id":"3dca018f-35e6-4697-80dd-f60765f49149","resolution":{"observed_at":"2026-08-15T20:16:36.458745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:38.032066Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":"4a347429-1cb7-4a4d-993e-fa98ff0d251d","year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.466766Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:98723917c7b61b5b1b4899e9ca83a17f4440a65b0f91f3084ba9c91f3194059b","observation_id":"a1b5da0e-e809-4a95-810e-2af0c068cc6b","resolution":{"observed_at":"2026-08-15T20:16:38.038928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08637","last_updated":"2026-04-09T06:53:44Z","snapshot_observed_at":"2026-08-12T15:49:04.743422Z","submitted_at":"2024-12-11T18:58:40Z","title":"DMin: Scalable Training Data Influence Estimation for Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08637","snapshot_observed_at":"2026-08-15T20:16:36.473362Z","title":"Dmin: Scalable training data influence estimation for diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.473362Z"},"links":{"cited_paper":"/paper/2412.08637","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:13bd16d7b7cf74f91182d0f40a63b80dbcb68fc2904aa82c750c582015d64524","observation_id":"135a407e-4e75-4019-902a-a41f79aba2e2","resolution":{"observed_at":"2026-08-15T20:16:36.473362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:38.012769Z","title":"Token-wise influential training data retrieval for large language models","venue":null,"work_id":"0e0cc58a-5c6d-4b48-8fa5-9e2bbc62579a","year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.480095Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:4ed2b01e254623f23db61fa379e30bbae566cb10c203b169ea00b6287b734246","observation_id":"ea3a709d-62b7-4745-b640-8c06eef6a010","resolution":{"observed_at":"2026-08-15T20:16:38.019293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13141","last_updated":"2025-02-18T18:59:00Z","snapshot_observed_at":"2026-08-16T12:57:12.560422Z","submitted_at":"2025-02-18T18:59:00Z","title":"UniGuardian: A Unified Defense for Detecting Prompt Injection, Backdoor Attacks and Adversarial Attacks in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13141","snapshot_observed_at":"2026-08-15T20:16:36.487502Z","title":"Uniguardian: A unified defense for detecting prompt injection, backdoor attacks and adversarial attacks in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.487502Z"},"links":{"cited_paper":"/paper/2502.13141","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:03f0189309f0840dfc90baa7971d89ff75bdca029c550a65ac1030b41c35dc06","observation_id":"f1ab93dd-d49d-4ce0-89b6-a50182fb56cf","resolution":{"observed_at":"2026-08-15T20:16:36.487502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:37.987600Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision, language, audio, and action","venue":null,"work_id":"d2e9b593-8234-4a7a-a9b2-4aae68ef8a6f","year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.493103Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:35d2352c2725c2631c2ae4b1811028dc38a0a758f8d48bfefaae24617c682fcb","observation_id":"05103f85-38f4-4ae8-ac6c-8141a6e11884","resolution":{"observed_at":"2026-08-15T20:16:37.994942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-16T13:20:41.485941Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-15T20:16:36.500770Z","title":"Open- magvit2: An open-source project toward democratizing auto-regressive visual generation.CoRR, abs/2409.04410, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.500770Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:c10ddbeb1c0c7fbc0764f53b98c3dde5bc0ba99a61713be541a354fce0130ead","observation_id":"5d2824b9-b490-4ea5-9cd5-26d9bd75015a","resolution":{"observed_at":"2026-08-15T20:16:36.500770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-16T14:29:11.134311Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17789","snapshot_observed_at":"2026-08-15T20:16:36.507549Z","title":"Token-shuffle: Towards high-resolution image generation with autoregressive models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.507549Z"},"links":{"cited_paper":"/paper/2504.17789","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:7d31d52a9608c5577373978d02436cea92e9223bf7d4579bf40e766ad90c1ada","observation_id":"f83de64b-06dd-478d-bd12-388f9ba8b9ae","resolution":{"observed_at":"2026-08-15T20:16:36.507549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:37.964815Z","title":"Blaschko, Guohao Dai, Huazhong Yang, and Yu Wang","venue":null,"work_id":"c70122b9-cc91-4f18-be47-98383c55e656","year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.513880Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:275f60dc62d795b500335931e86ecebd2a133188200db7af65ae33055185d747","observation_id":"d13a32ad-66c6-4e74-a2c8-081202648097","resolution":{"observed_at":"2026-08-15T20:16:37.971465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:36.524284Z","title":"Introducing 4o image generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.524284Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:bb433610b0bd83bb3a31a0c1c85550c92879ecd0a2f793d3ea8515d62f794196","observation_id":"b30d8c8b-1591-4933-95b9-e2207f1105d7","resolution":{"observed_at":"2026-08-15T20:16:36.524284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01052","last_updated":"2025-05-12T18:28:48Z","snapshot_observed_at":"2026-08-16T12:53:47.592187Z","submitted_at":"2025-03-02T22:51:12Z","title":"ALinFiK: Learning to Approximate Linearized Future Influence Kernel for Scalable Third-Party LLM Data Valuation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01052","snapshot_observed_at":"2026-08-15T20:16:36.531312Z","title":"Alinfik: Learning to approximate linearized future influence kernel for scalable third-parity LLM data valuation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.531312Z"},"links":{"cited_paper":"/paper/2503.01052","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:2e5c42956be3095a14d99ea20f58b3121e9ba363ffca6b38d51b927c51b57b01","observation_id":"9967247f-93ea-4f43-9020-89cb3ac4482b","resolution":{"observed_at":"2026-08-15T20:16:36.531312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:37.920429Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"7e2a163a-6d2c-4ee8-9520-8985d29b31ad","year":2023},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.536456Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:cc56e6f1b2efeef16f8463d352c64a8df228769c430becd1c84f17da9b2b4bbe","observation_id":"5ee96cbb-b416-476c-9567-5bb9f58cc224","resolution":{"observed_at":"2026-08-15T20:16:37.929121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:36.542561Z","title":"Reasoning with large language models, a survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.542561Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:b357de31d05fff3f0d140c18719294ad44fa31cc2a3267245c466b99d274ba32","observation_id":"8279ae23-be39-4867-b902-05795387f8f3","resolution":{"observed_at":"2026-08-15T20:16:36.542561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-15T20:16:36.548934Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.548934Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:f5bb23ca187a7d829fdb0e0d4d485b0123dbafc2316fbbbc985a8318b322a1aa","observation_id":"a677e66f-0014-4f3e-aaaf-a910fedb4a03","resolution":{"observed_at":"2026-08-15T20:16:36.548934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:37.896421Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":"b5afecab-8a3c-4e30-b900-59833586cb60","year":2022},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.557363Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:a326fee3bc4389c0e2e52c22f288dc507ca3bca2af0db808063ffcd706d0f309","observation_id":"f678be5b-2c8b-47f3-a3c0-6b5e9c09c1c8","resolution":{"observed_at":"2026-08-15T20:16:37.902423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:37.871807Z","title":"Bernstein, Alexander C","venue":null,"work_id":"8a7a8250-2d39-46c6-8f94-d4b7227f6e4b","year":2015},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.563815Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:960299dbbedd24718675a887fa3b5c8df0a61e37fd253156d41ff1a3bc8b7543","observation_id":"dcccecc1-3ad7-4d4c-becb-eac94a414194","resolution":{"observed_at":"2026-08-15T20:16:37.878116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:36.570432Z","title":"Flow to the mode: Mode- seeking diffusion autoencoders for state-of-the-art image tokenization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.570432Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:5f4a778770aeaa58d65bf184be39804b3ca21099ed130038e67555fe1a6c0c85","observation_id":"075afcea-125e-4910-ac84-9813d4aa96c9","resolution":{"observed_at":"2026-08-15T20:16:36.570432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:37.850651Z","title":"Drivelm: Driving with graph visual question answering","venue":null,"work_id":"66247e86-12ff-40bf-968a-e7f5b555e94e","year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.580593Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:bc13738328a2c0999d0b05d9200f12627ee83057864c2022c97552e1620a06db","observation_id":"dedf71b8-daa2-4b2b-b43b-7ae23469a3f9","resolution":{"observed_at":"2026-08-15T20:16:37.857053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-15T20:16:36.588401Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.588401Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:bbfa916df5e6a5ef0fe798822df793727596f0cd5f82b125f09a7abaeff345fa","observation_id":"71b0f393-a913-400e-854b-6d81b7579d0c","resolution":{"observed_at":"2026-08-15T20:16:36.588401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-15T20:16:36.594006Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.594006Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:17fa9a948926ad870a09fbd49ebb3e52ec3ba7d646c6a7853dbd65083fdc6703","observation_id":"a23b861a-d57b-4505-9476-2a0a2abbb635","resolution":{"observed_at":"2026-08-15T20:16:36.594006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:37.829908Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":"9743feda-270b-456b-86c2-f18a8e57957f","year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.608247Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:069649d458b9c43a8c4779f0f41b014a13ab5ea51bfcd8ae64ca657a21c15908","observation_id":"75d46c6d-b531-4021-8991-219e7328869e","resolution":{"observed_at":"2026-08-15T20:16:37.836930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T20:16:36.614723Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.614723Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:a5fc49bb7bd6b83e3176f84331ffb7810fe8cf4d9586bd00f7ac25726925bef1","observation_id":"dd99bfe0-6c01-4926-90c7-7c4efe76a536","resolution":{"observed_at":"2026-08-15T20:16:36.614723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:37.798570Z","title":"Neural discrete representation learning","venue":null,"work_id":"e2187af5-4fb2-4419-8913-f0f9f7cda5be","year":2017},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.622958Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:3d60fe364f79341befda9f2c8f9141a2b0485d2c09e751dd783840b1cbf58f1a","observation_id":"7d22ed68-bec4-4b7a-a314-a11af275c057","resolution":{"observed_at":"2026-08-15T20:16:37.807855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12223","last_updated":"2023-05-23T10:35:35Z","snapshot_observed_at":"2026-08-16T15:31:28.364557Z","submitted_at":"2023-05-20T16:11:26Z","title":"What Makes for Good Visual Tokenizers for Large Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12223","snapshot_observed_at":"2026-08-15T20:16:36.633448Z","title":"Kankanhalli, and Ying Shan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.633448Z"},"links":{"cited_paper":"/paper/2305.12223","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:6694672044e75b2afced3cf7025efb1b30c592d3bad0f8f8dc0ecf1e71d4d26c","observation_id":"ce548559-a3d4-4656-aa8f-3527fdad1767","resolution":{"observed_at":"2026-08-15T20:16:36.633448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16211","last_updated":"2024-12-08T19:55:36Z","snapshot_observed_at":"2026-08-16T13:15:48.133270Z","submitted_at":"2024-09-24T16:12:12Z","title":"MaskBit: Embedding-free Image Generation via Bit Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16211","snapshot_observed_at":"2026-08-15T20:16:36.642689Z","title":"Maskbit: Embedding-free image generation via bit tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.642689Z"},"links":{"cited_paper":"/paper/2409.16211","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:10e2e8731300918fd87da905ca8ebd58112267439a7004639d949f7a4c1b1067","observation_id":"29281ab3-185d-4244-a02c-96e4c07fcc0d","resolution":{"observed_at":"2026-08-15T20:16:36.642689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-13T14:27:40.753031Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-15T20:16:36.649273Z","title":"Liquid: Language models are scalable multi-modal generators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.649273Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:5cbad25c11209fecdae7de6ce18fae6a3586c2e088bf6b1d19784fd106e340d7","observation_id":"9cf2c012-4a29-4f47-b383-f2762e1cc16e","resolution":{"observed_at":"2026-08-15T20:16:36.649273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-15T20:16:36.655133Z","title":"VILA-U: a unified foundation model integrating visual understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.655133Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:3501181d6b7292cf912887ccc9924686c5cc46e5a663b4b1e5734b4e72503c91","observation_id":"340e14b2-33d6-4a46-861e-ad764a3fbe8a","resolution":{"observed_at":"2026-08-15T20:16:36.655133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-15T20:16:36.662678Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.662678Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:a4c119e0e5b56bf2ac9507a3b47bbdc302953e735eafcf7cdfb785213f9df3c2","observation_id":"30cfff84-9fc7-4114-af0a-bfae6c15be7e","resolution":{"observed_at":"2026-08-15T20:16:36.662678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02782","last_updated":"2025-05-02T04:42:06Z","snapshot_observed_at":"2026-08-16T12:44:11.307327Z","submitted_at":"2025-04-03T17:23:16Z","title":"GPT-ImgEval: A Comprehensive Benchmark for Diagnosing GPT4o in Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02782","snapshot_observed_at":"2026-08-15T20:16:36.676564Z","title":"Gpt-imgeval: A comprehensive benchmark for diagnosing gpt4o in image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.676564Z"},"links":{"cited_paper":"/paper/2504.02782","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:5e6f82e4da0df52b09a086f7f139ebf417c5139b06e3225d08fef0968a51c73c","observation_id":"76efe441-a51c-424d-bced-dc848b720fc6","resolution":{"observed_at":"2026-08-15T20:16:36.676564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:37.774894Z","title":"Diffusion models: A comprehensive survey of methods and applications","venue":null,"work_id":"483d3011-4d84-4e59-bf5f-0ea7f70006c9","year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.685791Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:17a1aa9f958aa82cad2f7fcdc6545db4ecf52162f30f68c9dc7e2a8c86bb1ba2","observation_id":"8c692157-d8d9-4124-9191-adb6d8deaf03","resolution":{"observed_at":"2026-08-15T20:16:37.780887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:37.754480Z","title":"Hauptmann, Ming-Hsuan Yang, Yuan Hao, Irfan Essa, and Lu Jiang","venue":null,"work_id":"6de85c73-d2cd-4432-93dd-cee6b21dee5f","year":2023},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.692217Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:978b4129a4917e0c8c46f096dc35e88064573e9d903a485f751e1df1809777b2","observation_id":"c372fb36-84b4-4a74-b57a-07ccf93ae185","resolution":{"observed_at":"2026-08-15T20:16:37.759971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:37.733542Z","title":"Hauptmann, Boqing Gong, Ming-Hsuan Yang, Irfan Essa, David A","venue":null,"work_id":"9d6e6ea6-5164-4312-a8e6-7882032a0d14","year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.697988Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:8135ecb5375cb26fab0a2516835a6e004a332331b0c45ae00821e67c399a76dc","observation_id":"be95616b-2bdc-4a0d-a803-151685542525","resolution":{"observed_at":"2026-08-15T20:16:37.740883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:37.700172Z","title":"An image is worth 32 tokens for reconstruction and generation","venue":null,"work_id":"eba2f72c-a421-4188-b7fb-3f66aad1f84d","year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.704093Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:b539fb8aaafdcbd03feb8b268cb9a356aa37f4abfd0d5c3f5f4b2af89510ce4b","observation_id":"69feac44-94b4-4641-be7f-0ce8ed4c4eb2","resolution":{"observed_at":"2026-08-15T20:16:37.715747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:37.677097Z","title":"A simple LLM framework for long-range video question-answering","venue":null,"work_id":"373eb2d0-c680-40d3-b45f-2b07e8da84e3","year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.711866Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:6b99e33a8fb87011451e2f18532420168d0c847755eeee006695c90864663289","observation_id":"16d4eb7e-1952-43e1-8c7b-b7807d352c6f","resolution":{"observed_at":"2026-08-15T20:16:37.684490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:37.645199Z","title":"Efros, Eli Shechtman, and Oliver Wang","venue":null,"work_id":"9343e6c1-8ae1-45f5-ba6a-c74567663b57","year":2018},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.718820Z"},"links":{"citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:13bba33857faf791bb5e2251c9c46fca2742465537aa52040db71ac4473a3528","observation_id":"5c3081dc-376c-4be7-b953-4568a12883b7","resolution":{"observed_at":"2026-08-15T20:16:37.656742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07548","last_updated":"2024-06-11T17:59:53Z","snapshot_observed_at":"2026-08-16T13:44:02.896780Z","submitted_at":"2024-06-11T17:59:53Z","title":"Image and Video Tokenization with Binary Spherical Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07548","snapshot_observed_at":"2026-08-15T20:16:36.724968Z","title":"I want to generate high-resolution images with a size of 1024× 1024. Please directly create 10 different fictional scenes for me and output them in JSONL format","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:36.724968Z"},"links":{"cited_paper":"/paper/2406.07548","citing_paper":"/paper/2505.13439"},"observation_digest":"sha256:919f1dbcfcdaddc90f69bb158aa90246d61b3a17ec15c69839ca85503348a5ad","observation_id":"51f42578-6c45-4910-a670-8fdc1494ba87","resolution":{"observed_at":"2026-08-15T20:16:36.724968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.13439","last_updated":"2025-05-19T17:59:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T14:13:03.335639Z","submitted_at":"2025-05-19T17:59:01Z","title":"VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 2 inbound Pith citation observations for arXiv:2505.13439."}