{"as_of":"2026-08-14T16:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb1c9a1f08b6890238a0ee6320b0c1ccc4335e6896af7ca31c44fe33c863f673","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:37:44.972598Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T01:12:13.426640Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T01:12:13.598677Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"cited_work":{"arxiv_id":"2505.18142","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18142","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tokbench: Evaluating your visual tokenizer before visual generation","venue":null,"work_id":"60665933-20ef-4a77-9c65-9c2e2495ac90","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2505.18142","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:6072c7a15af59aa31576923fd8026d0f34efae08152b738919cfa68feaddbe1d","observation_id":"e7d36cc0-c561-47c3-9812-501d86938b6c","resolution":{"observed_at":"2026-05-18T01:12:13.600645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"cited_work":{"arxiv_id":"2505.18142","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18142","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tokbench: Evaluating your visual tokenizer before visual generation","venue":null,"work_id":"60665933-20ef-4a77-9c65-9c2e2495ac90","year":2025},"citing_paper":{"arxiv_id":"2605.14333","last_updated":"2026-05-14T03:57:25Z","snapshot_observed_at":"2026-08-02T04:28:22.039399Z","submitted_at":"2026-05-14T03:57:25Z","title":"InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T02:10:18.004724Z"},"links":{"cited_paper":"/paper/2505.18142","citing_paper":"/paper/2605.14333"},"observation_digest":"sha256:241d66ddc0d131dfeeb4a305978f8fe84c272fd41b66a52e7492639dd2aa2598","observation_id":"e1dc9a3d-6ca7-47f4-8ae3-15984e8730ab","resolution":{"observed_at":"2026-05-15T02:13:30.541166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18142/citation-record","integrity":"/paper/2505.18142/integrity","json":"/paper/2505.18142/citation-record.json","paper":"/paper/2505.18142"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:50.362969Z","title":"FlexTok: Resampling images into 1d token sequences of flexible length.arXiv 2025, 2025","venue":null,"work_id":"f0fe127e-d601-4371-9889-f4092f47f013","year":2025},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:38.942520Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:de744f5538c904eb26f369d71672e2db5ac2826e6d21869dedda81d07f651523","observation_id":"7d9c3038-8e4e-424a-85b7-f4382bcbeb4b","resolution":{"observed_at":"2026-08-07T14:37:50.416395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:50.194978Z","title":"Scene text recognition with permuted autoregressive sequence models","venue":null,"work_id":"86ae1993-bb4f-4541-bd59-eeb686ab2114","year":2022},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:38.973992Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:b2d17941583de031b005a98fb0c8ef79a60789070037b0bd040d4154889f3d7d","observation_id":"d1d16717-d3f8-4039-adac-75c7e42e31e9","resolution":{"observed_at":"2026-08-07T14:37:50.260272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:50.093896Z","title":"Total-text: toward orientation robustness in scene text detection.Int","venue":null,"work_id":"1a5130c3-349b-4376-af51-f63ef6dc61d6","year":2020},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:39.037498Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:455413a63e5beca5af98d660dc1ae065b96ac7a38dffd5d86c5c4c69f0af81fb","observation_id":"566e5880-ecd6-434b-9591-28cdbbf86495","resolution":{"observed_at":"2026-08-07T14:37:50.139417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.05789","last_updated":"2019-10-30T10:53:11Z","snapshot_observed_at":"2026-08-12T21:10:50.050168Z","submitted_at":"2019-03-14T02:11:17Z","title":"Diagnosing and Enhancing VAE Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.05789","snapshot_observed_at":"2026-08-07T14:37:39.114745Z","title":"Diagnosing and enhancing vae models.arXiv preprint arXiv:1903.05789, 2019","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:39.114745Z"},"links":{"cited_paper":"/paper/1903.05789","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:d6744cfa15c07b055acb055cf85249b397d2ce5aaf4dfd30924f5e133331b4ba","observation_id":"0e083a73-7b2d-4ba5-a9b0-112aaa6f68e0","resolution":{"observed_at":"2026-08-07T14:37:39.114745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:49.914120Z","title":"Imagenet: A large- scale hierarchical image database","venue":null,"work_id":"89158070-2dbb-4e46-add0-b7aada6d64be","year":2009},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:39.140584Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:dffd659e5357b06ac2deacd193f599eabf8a0df52871e9d33aba91a98bd99044","observation_id":"5dfdf3e5-23fc-4ce3-9af1-282badee32c1","resolution":{"observed_at":"2026-08-07T14:37:50.019893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:39.146369Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:39.146369Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:0cf8d4201bc434ca4483affa9878e9b32c8cba31a1f67a2537fa362f4d4973ee","observation_id":"1de34a10-11e6-4bf7-9ad8-697e4f619de5","resolution":{"observed_at":"2026-08-07T14:37:39.146369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:39.187332Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:39.187332Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:20b5964eb1077662079ab5e89ff28110ab02bf31249657963eadb390bc455289","observation_id":"ecd28181-a582-44b1-a2c2-0224422abf5c","resolution":{"observed_at":"2026-08-07T14:37:39.187332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-08-14T02:42:50.349648Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-08-07T14:37:39.229146Z","title":"Data filtering networks.arXiv preprint arXiv:2309.17425, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:39.229146Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:03580fb0c2ca234363d72d44b4731bdb9b52cb51114073f939c01657a19ee45b","observation_id":"067ee8d7-cd52-48a9-a7b7-c98492576d0a","resolution":{"observed_at":"2026-08-07T14:37:39.229146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:39.318032Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:39.318032Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:22fee802da68ad27aee4ba5a93e5ca9d29ff0a41c1ac013bcce00124cbe17dfb","observation_id":"cffcd49e-7dfa-4b18-986c-8ccce2b9230a","resolution":{"observed_at":"2026-08-07T14:37:39.318032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T14:37:39.414670Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:39.414670Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:af0e0fee002502be1be464e5116e86f85d573258082175e48334dd1a8f468bf7","observation_id":"e6b1b01c-0271-453d-b844-fb382b5b2d93","resolution":{"observed_at":"2026-08-07T14:37:39.414670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:39.478304Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:39.478304Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:8bc1e8ce147c4c5d5d307ad981133c100ba08d4db714966dc91d0b764f058136","observation_id":"e6cfa880-ca64-442c-9574-e23513a75cc0","resolution":{"observed_at":"2026-08-07T14:37:39.478304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:39.541439Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:39.541439Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:b651e81992ae34a35cdd4defba559d578f88d9d0902c33ee4a4862f6a29c87b6","observation_id":"166c86ec-9691-4b59-9743-30e41df6398f","resolution":{"observed_at":"2026-08-07T14:37:39.541439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:49.728557Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":"a0347279-672a-4300-8086-4df5d43c8bc8","year":2023},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:39.598864Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:127b6bf35eb2f77eb7af66b0fb12841b6df8c18bc23b0fdfe1fe522d22c96480","observation_id":"330b65b7-c6e4-4b06-9fba-974dec16a38a","resolution":{"observed_at":"2026-08-07T14:37:49.802193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:39.639427Z","title":"Labeled faces in the wild: A database forstudying face recognition in unconstrained environments","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:39.639427Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:ddf1167a45f2764ffc419c4ba3910c33d117c076b3c0f76fd743a02ae49cdf15","observation_id":"d084e74e-f496-4c81-83c6-40ef2e818309","resolution":{"observed_at":"2026-08-07T14:37:39.639427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:49.588568Z","title":"Icdar2019 competition on scanned receipt ocr and information extraction","venue":null,"work_id":"93745dc5-d405-422e-8bbb-bc4637e31589","year":2019},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:39.699579Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:bd43f68537710eff612997d5bf5eb1211735fda854d3000a9dfeda0e88080152","observation_id":"c15cf2e1-b155-40a3-bd54-428ab09d12f2","resolution":{"observed_at":"2026-08-07T14:37:49.648190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:49.482332Z","title":"insightface.https://github.com/deepinsight/insightface, 2024","venue":null,"work_id":"6f510337-0185-41b4-822d-5f08adde254d","year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:39.808619Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:7c223c4786b337ff763d481d9d566170f404aacc8ace22219baaa7025473b66b","observation_id":"9e365d38-7e7a-4264-bafb-1dd3f3f3ec3a","resolution":{"observed_at":"2026-08-07T14:37:49.524309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:49.321919Z","title":"Icdar 2015 competition on robust reading","venue":null,"work_id":"f6ed0130-bd36-4752-9be1-62c4c57ae7e7","year":2015},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:39.869169Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:e1a7cb80b9e15a5d887d38678f354e6577ee5b9d59e8906df4496cc84551a5e3","observation_id":"2c70ae5f-1502-4cb4-a9ad-ce61050dbeec","resolution":{"observed_at":"2026-08-07T14:37:49.415521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:49.215317Z","title":"Icdar 2013 robust reading competition","venue":null,"work_id":"8844c2e9-e226-4d31-9c7c-639c06b88558","year":2013},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:39.960164Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:5e8de52837e22cca45090abfb15d8fe60d33d205d0387c4158e17b280708df7b","observation_id":"a046604f-6fd7-4b6a-bbfc-812468bca38a","resolution":{"observed_at":"2026-08-07T14:37:49.266858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:40.038050Z","title":"Kingma and Max Welling","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:40.038050Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:f49188cebf20942948569ab7534d690531e77d57941111b6e56e8803bc249a89","observation_id":"e1db9af6-462c-4336-90ae-cfc5dcb334f3","resolution":{"observed_at":"2026-08-07T14:37:40.038050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:49.055120Z","title":"Annotated facial landmarks in the wild: A large-scale, real-world database for facial landmark localization","venue":null,"work_id":"21a72dc2-0266-4dec-b36a-59cda955a13c","year":2011},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:40.108398Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:1cdd81fac0d71b0e1e8f59a5f703c42fbbc1eaeb014a048e5973123f72bef7ee","observation_id":"faf4cb1e-e130-4e5e-a3e9-aa1d59b4ae96","resolution":{"observed_at":"2026-08-07T14:37:49.160054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T14:37:40.286864Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:40.286864Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:fbc359d932789cded688dbfca298c65c5facbde58121256313603a3d5ab343f8","observation_id":"a5f80af4-8c69-4a63-9bd6-bcf1f6b4e518","resolution":{"observed_at":"2026-08-07T14:37:40.286864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:40.397855Z","title":"Flux.https://github.com/black-forest-labs/flux, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:40.397855Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:cfb8a85039adb14bd49eba7fd3b435d72a88ef1064441256b2cbabf06408d0b0","observation_id":"1a696323-83ad-44a4-a2a4-4018e7923248","resolution":{"observed_at":"2026-08-07T14:37:40.397855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:40.535136Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:40.535136Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:9b0145b3d7fe5d2b9e9a9229122d4bc6413a355bbb953fa8b5a773ebbe4d1137","observation_id":"b5664d69-fbbf-43f3-a7f2-f3471e1b30eb","resolution":{"observed_at":"2026-08-07T14:37:40.535136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-13T21:19:07.777045Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-07T14:37:40.645016Z","title":"Open-sora plan: Open-source large video generation model.arXiv preprint arXiv:2412.00131, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:40.645016Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:eb013fc6f6561425352241cd234e542d0b74310f91384ea090d6fc5a5791ea97","observation_id":"da86b6ff-b655-4e29-9a7c-dee1e1e2455f","resolution":{"observed_at":"2026-08-07T14:37:40.645016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-14T09:16:47.522119Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-07T14:37:40.720001Z","title":"World model on million-length video and language with ringattention.arXiv preprint arXiv:2402.08268, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:40.720001Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:93404f128e263d25b479c60c1e21bae260309e09a9b72b88a2cf457d6d89eb4b","observation_id":"9e607ba7-41bb-4003-b4c4-02d081620dde","resolution":{"observed_at":"2026-08-07T14:37:40.720001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:48.874834Z","title":"Abcnet: Real-time scene text spotting with adaptive bezier-curve network","venue":null,"work_id":"6cf1679b-083e-42a2-bb4e-b25c7f171c57","year":2020},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:40.836873Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:75510b68f3bbab734f196b4e04e29c7142c5a572438364b58b06256ded5c8ce1","observation_id":"b70b03da-bf99-490b-b971-e2a87c711fa4","resolution":{"observed_at":"2026-08-07T14:37:48.958934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:48.667704Z","title":"Curved scene text detection via transverse and longitudinal sequence connection.Pattern Recognition, 90:337–345, 2019","venue":null,"work_id":"fb6bc210-c450-453e-acb9-4e0297400142","year":2019},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:40.946666Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:291c7f6006f9382c1f892d3d7aec478250470a92aadafad7649e06a034bd6b8c","observation_id":"66980f6f-f201-49f4-9efd-6164576050e7","resolution":{"observed_at":"2026-08-07T14:37:48.771284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-14T02:43:25.975990Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-07T14:37:41.105052Z","title":"Open- magvit2: An open-source project toward democratizing auto-regressive visual generation.arXiv preprint arXiv:2409.04410, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:41.105052Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:34f261ddfc00be12f24bd7162d029eaf1d45387f399e3a488c60f1e20c5e6f8e","observation_id":"3fecfe9b-a345-42f1-aa6a-339a35991465","resolution":{"observed_at":"2026-08-07T14:37:41.105052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:41.256151Z","title":"Unitok: A unified tokenizer for visual generation and understanding.arXiv preprint arXiv:2502.20321, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:41.256151Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:5199992448da190cd72fd30fb44ad655576695493747e0d455f4908fb887d668","observation_id":"e64fd548-340e-4b09-bdd8-d31fc4459e51","resolution":{"observed_at":"2026-08-07T14:37:41.256151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-07T14:37:41.363946Z","title":"Step-video-t2v technical report: The practice, challenges, and future of video foundation model.arXiv preprint arXiv:2502.10248, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:41.363946Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:a791e70eab8e2057045095200c1cf619bbe1664ae6f043966fffb622f43ca47d","observation_id":"45701260-5e76-4360-a0bc-f62457671fb6","resolution":{"observed_at":"2026-08-07T14:37:41.363946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:48.433470Z","title":"Hdr-vdp-2: A calibrated visual metric for visibility and quality predictions in all luminance conditions.ACM Transactions on graphics (TOG), 30(4):1–14, 2011","venue":null,"work_id":"a2049771-dc5e-421e-ab17-f96c29942749","year":2011},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:41.456959Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:2fd5e47e7ea28025339d017c066ee6419db091f5b38eaa500a155a50e2b2f233","observation_id":"835bbf6e-6e1d-451b-9d7b-6ec72f43f148","resolution":{"observed_at":"2026-08-07T14:37:48.528744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:41.563845Z","title":"Infographicvqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:41.563845Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:9c21bbd5ab7a5e7a04c47d3607bdcd9776056ee67051529ab36f5860de272a8f","observation_id":"1f4aaf38-7b58-4bdf-812d-87b8fca32974","resolution":{"observed_at":"2026-08-07T14:37:41.563845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:48.216441Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"f1d7647d-a9bf-4f1e-aaf6-d5b4f4a90bc5","year":2021},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:41.662054Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:92a03a5dd1c71f3a8a8942d7ba4931cacb8c9c59583196e79435efaa71da601f","observation_id":"dac05f3d-9fce-41ab-aece-4b30779e592e","resolution":{"observed_at":"2026-08-07T14:37:48.319540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-07T14:37:41.765000Z","title":"Finite scalar quantization: Vq-vae made simple.arXiv preprint arXiv:2309.15505, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:41.765000Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:dd2d68f680322f3a0a209025e80afffac10e81a134b0b4b7e271fcf498a4278b","observation_id":"1e369fcf-fb81-4b77-81f8-3333278266aa","resolution":{"observed_at":"2026-08-07T14:37:41.765000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:48.042243Z","title":"doctr: Document text recognition.https://github.com/mindee/doctr, 2021","venue":null,"work_id":"82c21e03-f7e1-40e7-a6d7-b29acac7ccb6","year":2021},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:41.871166Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:8a0bf1f7e76965c80e76b83867b2a141dc3d5ba8da20b3699e43dce4239694ac","observation_id":"87defef3-f231-4be0-9e22-b87e63ef7ece","resolution":{"observed_at":"2026-08-07T14:37:48.117767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:47.806366Z","title":"Icdar2017 robust reading challenge on multi-lingual scene text detection and script identification-rrc-mlt","venue":null,"work_id":"4c77381e-44a6-46c4-86a1-449396c6cc2d","year":2017},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:41.965442Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:694efcbf584875506083151f11d6a61e51c9991f4ecc9f3ef9f8492010b271f8","observation_id":"93e16940-7226-46cf-ac0e-217340c5ddf8","resolution":{"observed_at":"2026-08-07T14:37:47.935892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:47.593491Z","title":"Cosmos-tokenizer","venue":null,"work_id":"419f95ab-d36f-4f6f-8be1-35608bb319ae","year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:42.066493Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:25ce6b01ae5a3a1bb46d600453cf2deed4d5537fbc2b14856b9034e99e9af986","observation_id":"b963c43a-d83b-4445-93d3-fc8e1f9df061","resolution":{"observed_at":"2026-08-07T14:37:47.699216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:47.386853Z","title":"Cord: a consolidated receipt dataset for post-ocr parsing","venue":null,"work_id":"1c1ea691-4ab3-4fd9-8005-c86779641be5","year":2019},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:42.187418Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:208b2e562ab8707d95912e954383041aaff161246a1d5d4c1738563da7080928","observation_id":"c87173a3-42e2-40fc-aa28-2dab1e7bd884","resolution":{"observed_at":"2026-08-07T14:37:47.483981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:42.269247Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:42.269247Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:671271ce1f83a84bcd76e4d71e96cc81f0bc8db5844a4a90eb827ee8a96b05f0","observation_id":"cba92258-d239-4595-a30e-82fa2a0c9d73","resolution":{"observed_at":"2026-08-07T14:37:42.269247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T14:37:42.347013Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:42.347013Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:4b3943e40353c1cbc43cff6d44a59d89b038c98ef3be7935a9344500f54d82f9","observation_id":"1753689a-7adf-4057-a67d-3d60ac265f26","resolution":{"observed_at":"2026-08-07T14:37:42.347013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-08-14T01:35:56.896431Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-07T14:37:42.504964Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation.arXiv preprint arXiv:2412.03069, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:42.504964Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:060c5636e058deaba40114f749318a09d7865c503fb7dbb941bea68398eb68aa","observation_id":"49711da3-9b0c-44c5-8b6b-ba35915ed162","resolution":{"observed_at":"2026-08-07T14:37:42.504964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:47.194401Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"1ed1fdd9-4ce5-4fc7-9ae8-ad32aba339a0","year":2021},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:42.630779Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:4091625f166a9132699465d5cf951f023a13ee615463d0e79e1452cabe447ec1","observation_id":"1b9a78cb-c3b5-46f2-a087-0fc2b6dc8cb1","resolution":{"observed_at":"2026-08-07T14:37:47.237168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:42.730140Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:42.730140Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:18fabf271502f82871c95e7f6ab65349767b39bcd56b5a8cb31f54b8eb63bb85","observation_id":"0f986f42-1425-4178-ae8d-2c254ac4dc00","resolution":{"observed_at":"2026-08-07T14:37:42.730140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:47.042281Z","title":"300 faces in-the-wild challenge: Database and results.Image and vision computing, 47:3–18, 2016","venue":null,"work_id":"e49ee531-6984-45dc-b3c9-c3b283bf801c","year":2016},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:42.844285Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:0a16d399b257c77a5a7f7f35b0bae467af258b84b00627e755f067afa6d1530f","observation_id":"ea06fae6-6a0b-4bf1-8665-eab066feac0c","resolution":{"observed_at":"2026-08-07T14:37:47.107375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:42.948794Z","title":"Improved techniques for training gans.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:42.948794Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:a3b1c27100b8128f3178ed4d4c8bbf9e56342dac7a9e4b7333e0f12dba57e144","observation_id":"55528374-26e8-4789-934d-b1f687d7e714","resolution":{"observed_at":"2026-08-07T14:37:42.948794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:46.771717Z","title":"Patel, Rama Chellappa, and David W","venue":null,"work_id":"8a577fa1-55a2-4337-a09a-73f17a73fdec","year":2016},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:43.087477Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:1b55e09edafb6f4444c9e1a95dcb19043fd72be72e051282b7cf104b244d4617","observation_id":"d114b335-4c23-403e-a5fd-36ff222695f9","resolution":{"observed_at":"2026-08-07T14:37:46.921190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:46.521861Z","title":"Tex- tocr: Towards large-scale end-to-end reasoning for arbitrary-shaped scene text","venue":null,"work_id":"30197acb-35e6-4775-b7da-5cbdb3a3d914","year":2021},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:43.293550Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:45c39f8f1982f456c8afeaa0dae9d88f9500970dc5cc2dc8c69867453d9e6107","observation_id":"030d9d74-52f5-4b67-8688-eb3bea14e91c","resolution":{"observed_at":"2026-08-07T14:37:46.641129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:43.405547Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:43.405547Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:827cb74d0de2a0e81a2082de4b38ba15cf9b2ddd318c870012c3fc47a4918146","observation_id":"ee319603-866d-47de-8cfd-377860463da3","resolution":{"observed_at":"2026-08-07T14:37:43.405547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T14:37:43.547722Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:43.547722Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:0b346ca7a701f4b4ff727b7ca9931fa81e4ca830f3f28f30f1815e2f7f9a2d71","observation_id":"d579e32a-5835-4b76-bfcd-d252459bf7e6","resolution":{"observed_at":"2026-08-07T14:37:43.547722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T14:37:43.641496Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:43.641496Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:1137cab5cf929175071ac58b127196c83d021a983dc6ddd287b1a60776f55baa","observation_id":"e7f241bc-dc4e-4325-8d68-cd9951e562e9","resolution":{"observed_at":"2026-08-07T14:37:43.641496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:43.679253Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.Advances in neural information processing systems, 37:84839–84865, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:43.679253Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:55bfb3e75ac2a0e78e42f3bafb6312a8da17ae5a6622ad8a8a3990a3e12fe2af","observation_id":"ddef94bd-2843-4ee2-9a80-afa8db31c78b","resolution":{"observed_at":"2026-08-07T14:37:43.679253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:43.700408Z","title":"Neural discrete representation learning.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:43.700408Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:868600534933e6c60a106f403a2f7e1ccf2496c15e99201de504bfea92eda3fc","observation_id":"abeefc72-8c68-414a-9286-e6152dbc2056","resolution":{"observed_at":"2026-08-07T14:37:43.700408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-08-07T14:37:43.735167Z","title":"Coco-text: Dataset and benchmark for text detection and recognition in natural images.arXiv preprint arXiv:1601.07140, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:43.735167Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:1e0904fbe1ad36e7f0b32fdba22c536f7c81cdb2f1a35426f38f5cd29da1c0a0","observation_id":"38445a59-5b55-45c8-93b6-7cff775f2e24","resolution":{"observed_at":"2026-08-07T14:37:43.735167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:46.336943Z","title":"Omnitok- enizer: A joint image-video tokenizer for visual generation","venue":null,"work_id":"b77f70d4-1448-4706-a8bf-efad809399e2","year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:43.769211Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:99a22a95334e01e4dfbf362d4b98c448063b0588f6f7972f3cce3efbb60ab026","observation_id":"f27b6b7a-b5da-4050-9dd8-70a7abc4efa5","resolution":{"observed_at":"2026-08-07T14:37:46.430205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16430","last_updated":"2025-08-29T02:25:47Z","snapshot_observed_at":"2026-08-14T02:44:16.414423Z","submitted_at":"2025-03-20T17:59:59Z","title":"Bridging Continuous and Discrete Tokens for Autoregressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16430","snapshot_observed_at":"2026-08-07T14:37:43.834494Z","title":"Bridging continuous and discrete tokens for autoregressive visual generation.arXiv preprint arXiv:2503.16430, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:43.834494Z"},"links":{"cited_paper":"/paper/2503.16430","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:f1410edfdf81b9b563adf536263b64d51a85646f6fcb3d2a73967b3ad1b11e46","observation_id":"09589777-01c0-41d9-a7fa-a71f727c6021","resolution":{"observed_at":"2026-08-07T14:37:43.834494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:43.896565Z","title":"Image quality assessment: from error visibility to structural similarity.IEEE Trans","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:43.896565Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:7d4b2977d29d5760e66202cd73e8ab0d6c1676f2c3d5502a9ff7e807227b1b38","observation_id":"7df56203-8bb8-43a9-9ae0-d2e0e0702ffe","resolution":{"observed_at":"2026-08-07T14:37:43.896565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:46.121325Z","title":"Maskbit: Embedding-free image generation via bit tokens.Transactions on Machine Learning Research, 2024","venue":null,"work_id":"0f5c9cb4-b7b1-493d-b681-b8893e05a853","year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:43.936059Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:270355f91cb692408d3395d1dd5b0216d3409b4d85b37d72f4ead7ea391bb0d6","observation_id":"a281c6ed-8266-4c27-b56b-e7cc58c55743","resolution":{"observed_at":"2026-08-07T14:37:46.225655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-13T14:27:40.753031Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-07T14:37:43.966306Z","title":"Liquid: Language models are scalable multi-modal generators.arXiv preprint arXiv:2412.04332, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:43.966306Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:110fba8b1a900a4e79a83b13d8a7289036557d11a83c6f83eadd31794bef451e","observation_id":"547639b4-fe7c-403f-be0c-81d633721b56","resolution":{"observed_at":"2026-08-07T14:37:43.966306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:45.945748Z","title":"Look at boundary: A boundary-aware face alignment algorithm","venue":null,"work_id":"8bfd2b8d-70b6-460c-8ef7-07cb17e1cb0f","year":2018},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:44.008316Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:d6d0fa6a9a8fc79b047afa1a0ba3f42cde5edaac1bb4b4bcfe05b518070a57c4","observation_id":"e2347e9c-686b-42a8-bf4e-ca9775cb6fe9","resolution":{"observed_at":"2026-08-07T14:37:46.011125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:45.798115Z","title":"Dstext v2: A comprehensive video text spotting dataset for dense and small text.Pattern Recognition, 149:110177, 2024","venue":null,"work_id":"cb0a995f-c325-4f29-84dd-d0612d660aa8","year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:44.055684Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:086522603a0c5cf1a2fe921fa0bb00ee881d9bb61424339f0f68ec9653944134","observation_id":"b9ffd809-d640-46c0-9b32-5213b6ef5073","resolution":{"observed_at":"2026-08-07T14:37:45.860861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-07T14:37:44.118090Z","title":"Sana: Efficient high-resolution image synthesis with linear diffusion transformers.arXiv preprint arXiv:2410.10629, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:44.118090Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:9af27339007fe2735d3aea4a27fae822033e58e3375a0684dc219a1c4cba4096","observation_id":"726cb930-b5b6-4752-ab8d-79fe5e5f7849","resolution":{"observed_at":"2026-08-07T14:37:44.118090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08377","last_updated":"2025-03-14T03:16:25Z","snapshot_observed_at":"2026-08-14T02:42:48.278755Z","submitted_at":"2025-03-11T12:38:12Z","title":"Layton: Latent Consistency Tokenizer for 1024-pixel Image Reconstruction and Generation by 256 Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08377","snapshot_observed_at":"2026-08-07T14:37:44.187102Z","title":"Layton: Latent consistency tokenizer for 1024-pixel image reconstruction and generation by 256 tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:44.187102Z"},"links":{"cited_paper":"/paper/2503.08377","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:e6d7a4057a1611199b7775c89a923d505c60262f2cc5d1fe119995f3121cdc87","observation_id":"0565b5fa-2ac5-4384-a627-9af4e521fb34","resolution":{"observed_at":"2026-08-07T14:37:44.187102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T14:37:44.252818Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:44.252818Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:79e1f4e96f6083505a68d6b1ede227bcf6b61b6d916e3c9fad8f1a71ae074953","observation_id":"8518d46d-7093-4fb5-8e16-b98a18de85a5","resolution":{"observed_at":"2026-08-07T14:37:44.252818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:44.317326Z","title":"Reconstruction vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:44.317326Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:4d379d7241f3c778216644535deebc990c295847f20d29f89caba4183ac0c89a","observation_id":"526033e1-549e-487a-86db-47208210f042","resolution":{"observed_at":"2026-08-07T14:37:44.317326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-07T14:37:44.404670Z","title":"Language model beats diffusion–tokenizer is key to visual generation.arXiv preprint arXiv:2310.05737, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:44.404670Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:5d4a1b663bb7882a8845efd6c37a69594e4ef6ffec7bd96def54a8e1c8705abd","observation_id":"e13fd772-71d1-45bf-a167-9e91cebc4184","resolution":{"observed_at":"2026-08-07T14:37:44.404670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:44.491066Z","title":"An image is worth 32 tokens for reconstruction and generation.Advances in Neural Information Processing Systems, 37:128940–128966, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:44.491066Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:8c09ebac44b3664139e8096dc113ee3d12328749e40a18bacbee49082cf74f3b","observation_id":"0f6d5428-0747-4474-a115-9e5cc92707fc","resolution":{"observed_at":"2026-08-07T14:37:44.491066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:45.647481Z","title":"Representation alignment for generation: Training diffusion transformers is easier than you think","venue":null,"work_id":"bc80eee8-dc9e-462d-8624-16e4d64e2330","year":2025},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:44.557257Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:bc8d86410ca0415781307d874f470be74cf3391f73d703a05b6f737cc54e1717","observation_id":"3978aac8-65c6-4e68-98ee-f3a3522bc270","resolution":{"observed_at":"2026-08-07T14:37:45.740170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:45.516174Z","title":"Fsim: A feature similarity index for image quality assessment.IEEE Trans","venue":null,"work_id":"17b421b1-994d-4e02-b6ec-10402e948d33","year":2011},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:44.647673Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:7a89c401a87e4a7cdf3feb9162fa55949b3f3f36199bb7beb27fa35c7116c98e","observation_id":"e4ff4ff2-b2a0-4462-8016-e90e675fa5a1","resolution":{"observed_at":"2026-08-07T14:37:45.595744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:44.720800Z","title":"The unrea- sonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:44.720800Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:15830f5d5d7a1d1936d91d73f5aa4a333d1c3638396de16940f7ead9d5103d22","observation_id":"72240bd9-087b-4fd1-869a-5549e04fea94","resolution":{"observed_at":"2026-08-07T14:37:44.720800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:45.361887Z","title":"Icdar 2019 robust reading challenge on reading chinese text on signboard","venue":null,"work_id":"de89ed1d-3c21-4ca5-97ee-1e81d117fb45","year":2019},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:44.764238Z"},"links":{"citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:03946dd86c25ca5597e5b933283a311d024f3d5025f1815def4d6dc6cc2a9744","observation_id":"b7c8214f-27be-44a3-bd25-f57e2114444a","resolution":{"observed_at":"2026-08-07T14:37:45.417894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07548","last_updated":"2024-06-11T17:59:53Z","snapshot_observed_at":"2026-08-14T02:44:15.496372Z","submitted_at":"2024-06-11T17:59:53Z","title":"Image and Video Tokenization with Binary Spherical Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07548","snapshot_observed_at":"2026-08-07T14:37:44.839423Z","title":"Image and video tokenization with binary spherical quantization.arXiv preprint arXiv:2406.07548, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:44.839423Z"},"links":{"cited_paper":"/paper/2406.07548","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:cc8cff4c3713e69d5fdbc78b05fdd1ef5ff60e66f97119f294d142a5396bb0c9","observation_id":"042198ce-a5bd-4b17-8d00-45b9a34297a5","resolution":{"observed_at":"2026-08-07T14:37:44.839423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.08197","last_updated":"2017-08-28T06:07:27Z","snapshot_observed_at":"2026-07-06T05:56:52.647438Z","submitted_at":"2017-08-28T06:07:27Z","title":"Cross-Age LFW: A Database for Studying Cross-Age Face Recognition in Unconstrained Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.08197","snapshot_observed_at":"2026-08-07T14:37:44.899699Z","title":"Cross-age LFW: A database for studying cross-age face recognition in unconstrained environments.CoRR, abs/1708.08197, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:44.899699Z"},"links":{"cited_paper":"/paper/1708.08197","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:faaec111fd091a444fc779bfc653f667d7e3e626bd81e76c7b62c461e7a31090","observation_id":"495aa698-b650-4e0a-92ee-96a86e7b73dd","resolution":{"observed_at":"2026-08-07T14:37:44.899699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-07T14:37:44.972598Z","title":"Open-sora: Democratizing efficient video production for all","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:44.972598Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2505.18142"},"observation_digest":"sha256:a1d86d481de80112c8c21b1c8bda94fd0f267378e5224d1e71e98a8cf1e13797","observation_id":"c59e8b27-7396-4544-93f3-795942258c45","resolution":{"observed_at":"2026-08-07T14:37:44.972598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.18142","last_updated":"2025-05-26T13:30:39Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T00:35:07.674633Z","submitted_at":"2025-05-23T17:52:16Z","title":"TokBench: Evaluating Your Visual Tokenizer before Visual Generation"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 2 inbound Pith citation observations for arXiv:2505.18142."}