{"as_of":"2026-08-13T16:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e9bbda59c9725a34c3c33e515b4bf5cf7132b7ac75f71ff80e322600b1432535","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:38:59.016813Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:08:56.991515Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T13:15:46.141356Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"cited_work":{"arxiv_id":"2507.02358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02358","snapshot_observed_at":"2026-07-01T13:15:46.141356Z","title":"Holistic tokenizer for autoregressive image generation","venue":null,"work_id":"49858cb8-ce5f-466f-8c68-68213f05656e","year":2025},"citing_paper":{"arxiv_id":"2601.01593","last_updated":"2026-05-18T03:12:58Z","snapshot_observed_at":"2026-08-13T07:53:28.730257Z","submitted_at":"2026-01-04T16:46:13Z","title":"Beyond Patches: Global-aware Autoregressive Model for Multimodal Few-Shot Font Generation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-21T16:57:09.843691Z"},"links":{"cited_paper":"/paper/2507.02358","citing_paper":"/paper/2601.01593"},"observation_digest":"sha256:dd1d7a041ac2e8d059b2af054223a619792aeef641d512ad7ef89ca052b063d6","observation_id":"bb3e2471-db05-46b2-8b51-ec49be88e55f","resolution":{"observed_at":"2026-05-21T17:00:24.115442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"cited_work":{"arxiv_id":"2507.02358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02358","snapshot_observed_at":"2026-07-01T13:15:46.141356Z","title":"Holistic tokenizer for autoregressive image generation","venue":null,"work_id":"49858cb8-ce5f-466f-8c68-68213f05656e","year":2025},"citing_paper":{"arxiv_id":"2605.06137","last_updated":"2026-05-29T13:39:42Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T12:35:51Z","title":"Autoregressive Visual Generation Needs a Prologue","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-08T13:52:42.834440Z"},"links":{"cited_paper":"/paper/2507.02358","citing_paper":"/paper/2605.06137"},"observation_digest":"sha256:3dd52dc361996fa850914e3a26a0e3939fd29c0c2b73ee3269ccc79135c792d7","observation_id":"905ba60f-6e16-45a7-972a-3ec9d6c518a9","resolution":{"observed_at":"2026-05-11T18:51:06.131823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"cited_work":{"arxiv_id":"2507.02358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02358","snapshot_observed_at":"2026-07-01T13:15:46.141356Z","title":"Holistic tokenizer for autoregressive image generation","venue":null,"work_id":"49858cb8-ce5f-466f-8c68-68213f05656e","year":2025},"citing_paper":{"arxiv_id":"2605.06137","last_updated":"2026-05-29T13:39:42Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T12:35:51Z","title":"Autoregressive Visual Generation Needs a Prologue","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-30T23:36:51.148162Z"},"links":{"cited_paper":"/paper/2507.02358","citing_paper":"/paper/2605.06137"},"observation_digest":"sha256:7235ff3800a782ea246127a3e6b81751d898b75f6c90ee3c3ef1ccd5000bfbcc","observation_id":"df5d4649-99d5-4acc-b5ba-e27dff8ba9c9","resolution":{"observed_at":"2026-07-01T13:15:46.142983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"cited_work":{"arxiv_id":"2507.02358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02358","snapshot_observed_at":"2026-07-01T13:15:46.141356Z","title":"Holistic tokenizer for autoregressive image generation","venue":null,"work_id":"49858cb8-ce5f-466f-8c68-68213f05656e","year":2025},"citing_paper":{"arxiv_id":"2605.16384","last_updated":"2026-05-11T10:51:02Z","snapshot_observed_at":"2026-08-13T00:17:25.064703Z","submitted_at":"2026-05-11T10:51:02Z","title":"Mutual Enhancement Between Global Tokens and Patch Tokens: From Theory to Practice","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-20T22:41:44.510546Z"},"links":{"cited_paper":"/paper/2507.02358","citing_paper":"/paper/2605.16384"},"observation_digest":"sha256:59e3ee04619b6dbcd3d3599a5cd06ac26bdd910786ebb483f9bf300d090d265a","observation_id":"46a1e380-e7af-4fea-93f9-fef960207ce2","resolution":{"observed_at":"2026-05-20T22:43:51.011171Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02358","snapshot_observed_at":"2026-08-06T11:55:28.222142Z","title":"Hita: Holistic tokenizer for autoregressive image generation.arXiv preprint arXiv:2507.02358, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T23:12:27.682802Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":1},"reference_index":158,"source":"pdf_text","source_observed_at":"2026-08-06T11:55:28.222142Z"},"links":{"cited_paper":"/paper/2507.02358","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:59c92f1006f2f1c81cb37253ff5219db75c34ab61038434c3de011140ec55c61","observation_id":"ef6a5064-ee26-4008-9be6-c0ea92797d5d","resolution":{"observed_at":"2026-08-06T11:55:28.222142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02358","snapshot_observed_at":"2026-08-08T17:08:56.991515Z","title":"Hita: Holistic tokenizer for autoregressive image generation.arXiv preprint arXiv:2507.02358, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T23:12:27.682802Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":2},"reference_index":158,"source":"pdf_text","source_observed_at":"2026-08-08T17:08:56.991515Z"},"links":{"cited_paper":"/paper/2507.02358","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:33ff2b1966bc2934b6b0b6befa0bdc338693589a16697423a612c2b4c686acf2","observation_id":"097f8f68-5784-47bc-9f43-159a302d156f","resolution":{"observed_at":"2026-08-08T17:08:56.991515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02358/citation-record","integrity":"/paper/2507.02358/integrity","json":"/paper/2507.02358/citation-record.json","paper":"/paper/2507.02358"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T20:38:52.370560Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:52.370560Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:21dcef89bc6e58b61d087c332ab96384f2d9591246b927f28dda2cec03017956","observation_id":"38a7daa6-d817-433f-a789-3a8c4cdfd152","resolution":{"observed_at":"2026-08-06T20:38:52.370560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-08-11T05:54:56.124984Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-06T20:38:52.463671Z","title":"Estimating or propagating gradients through stochastic neurons for conditional computation","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:52.463671Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:2de24ef89efba72ca6edaebc40b40e30c82adf66d2e403439d80f1a1bd6985cd","observation_id":"26bcef4e-bfea-4b47-a269-45b8a038aeb9","resolution":{"observed_at":"2026-08-06T20:38:52.463671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-06T20:38:52.594227Z","title":"Paligemma: A versatile 3b vlm for trans- fer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:52.594227Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:a802302bb0cb7125c5c2958b99d3182180c8f94baab5e244342e628c167185ac","observation_id":"f0cae618-4702-4168-9473-9b49a4c4a42a","resolution":{"observed_at":"2026-08-06T20:38:52.594227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-06T20:38:52.661610Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:52.661610Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:a20d5b2749482388f7f0720eaf3ac6ef7aa4c78e1d905831bb23d21193befd55","observation_id":"6a6c0e96-5520-4e83-8984-f8992e990257","resolution":{"observed_at":"2026-08-06T20:38:52.661610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:04.492104Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":"aeef8459-6d2d-49dc-8f6e-feb492d554c9","year":2022},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:52.788853Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:9535da247401071b4d07364efe19bc1d00b0f323e79394a6d4c95b45323312e1","observation_id":"f2d1aca6-9934-4a6f-8e92-5c2120ce748b","resolution":{"observed_at":"2026-08-06T20:39:04.580025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:04.259025Z","title":"Generative pre- training from pixels","venue":null,"work_id":"75b5f1cc-f8cd-45bd-80ce-12486974bc54","year":2020},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:52.888937Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:53264e1cc07efaae6f38e41b9042cd7887965d70180ede40177a34d40bd386fe","observation_id":"78ee99b0-abfe-4513-83cc-0b384278d7df","resolution":{"observed_at":"2026-08-06T20:39:04.367468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:04.061869Z","title":"Vision transformers need registers, 2023","venue":null,"work_id":"81ba6bce-9ac1-434c-bead-085c3a68b1a1","year":2023},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:52.971868Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:e412ed4f78d49395ba94643934e28c6354a17b4ce63fa620b23c3347bd11b120","observation_id":"6bf58c75-92aa-4dc5-8158-78711f2d82ad","resolution":{"observed_at":"2026-08-06T20:39:04.166656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:03.861942Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"0f69b481-05fc-4cc8-abba-8bde372d692d","year":2009},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:53.061357Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:e65750a2f4297e054020c23a3c37a2e7003f8d30d27d9b5ccc9846326288c37a","observation_id":"bd26107b-5482-4545-96ec-e301477f2c7e","resolution":{"observed_at":"2026-08-06T20:39:03.961722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T20:38:53.170599Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:53.170599Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:05aaf38c0b3920002bed9e53c4b0f5969659a16bea46f2f20e6a74871add0c00","observation_id":"09815a26-6932-453e-8eb4-1e6aa7d6c800","resolution":{"observed_at":"2026-08-06T20:38:53.170599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:03.683729Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":"a85f5895-7caf-4e20-9101-a85bd90b6845","year":2021},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:53.249840Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:a3de61f95afbcb713d86c755ab569c925a64585ddf3192f315586131d98e9360","observation_id":"c4afe126-cff9-4c55-823f-a13829e17d81","resolution":{"observed_at":"2026-08-06T20:39:03.752678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08541","last_updated":"2024-01-16T18:03:37Z","snapshot_observed_at":"2026-08-13T04:41:49.603230Z","submitted_at":"2024-01-16T18:03:37Z","title":"Scalable Pre-training of Large Autoregressive Image Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08541","snapshot_observed_at":"2026-08-06T20:38:53.354253Z","title":"Scalable pre- training of large autoregressive image models.arXiv preprint arXiv:2401.08541, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:53.354253Z"},"links":{"cited_paper":"/paper/2401.08541","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:3e2ff132a8f4cec309c8730f56a657539526cabfe87822847b77b52cdef25e42","observation_id":"a87c79cf-73ab-4575-9598-d4760d41a977","resolution":{"observed_at":"2026-08-06T20:38:53.354253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:03.480462Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"b4e3f42c-9b04-47df-b235-49a90e27978f","year":2021},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:53.446728Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:927f6dabd9f379cbd045e9fda83d46628e62c5643812a6b452ce2bcd8a55af2e","observation_id":"68e48bbf-9dd6-42d0-966e-7733573e78bb","resolution":{"observed_at":"2026-08-06T20:39:03.570862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:03.343288Z","title":"Bard, 2023","venue":null,"work_id":"23ea8455-0979-4e98-ba1b-089eb7937942","year":2023},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:53.561406Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:9ed6d4fb30e01ab885b77edf62f352334fc970e74a9e5e6fe57cda18a2e601df","observation_id":"252b5d1f-2fa6-44ba-9913-5a91f4bbdfc1","resolution":{"observed_at":"2026-08-06T20:39:03.405061Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:03.229436Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"022d35ad-9452-4c1a-9d4b-8f06e3b27e99","year":2016},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:53.652716Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:35e7adf08c3652891f5972a944c1e8ff03de8cd8a4a7936a470f555098c048ed","observation_id":"5dd010f8-adac-42a8-8a97-432f3f39ae80","resolution":{"observed_at":"2026-08-06T20:39:03.279659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:03.033766Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"59ce0c6b-a653-4d5d-9739-a075bdecf824","year":2022},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:53.798678Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:7edf265049cdba887418b88e80b4912523eeee97551cb9fad804102020fdc463","observation_id":"6ff93a87-2e27-4d7c-8415-f1dfc9127758","resolution":{"observed_at":"2026-08-06T20:39:03.116615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-06T20:38:53.883035Z","title":"Scaling laws for autoregressive generative modeling","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:53.883035Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:a8f99081df2ba5f3eb781d25a65d6939f82b26cac485332c44d616ba9388b3ad","observation_id":"bf617df7-6a61-4783-a33b-30d5a1518c0c","resolution":{"observed_at":"2026-08-06T20:38:53.883035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:53.982040Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:53.982040Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:687d193ba576cd65b9ff38ac664a4e52717019ec63e04e23250f7d2f1ace2c2a","observation_id":"a6ad18ef-808a-4947-a520-9ace8aef4962","resolution":{"observed_at":"2026-08-06T20:38:53.982040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-12T19:28:23.372660Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-06T20:38:54.116873Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:54.116873Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:0c94034d9df08db4f1834e0dfd6e3fb638f669fcabaa6a4889dde436be9c3386","observation_id":"0eb50e1d-dcee-40e5-995b-2fcdf09fe20d","resolution":{"observed_at":"2026-08-06T20:38:54.116873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:02.859247Z","title":"Cascaded diffu- sion models for high fidelity image generation","venue":null,"work_id":"e59a4d11-a1ac-4a6f-b0b1-2a8fe9e97439","year":2022},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:54.213500Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:dbe1e6f6edf8c99158b15f1aaf2edef7324f8145a7ced52f11ba8451160b87f7","observation_id":"8804c6a8-a0b1-484b-b985-8ff63bf3a477","resolution":{"observed_at":"2026-08-06T20:39:02.919211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:54.332729Z","title":"Image-to-image translation with conditional adver- sarial networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:54.332729Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:a02f91908b097b6b915719f5b061f6aa35822225e020ac0c3b525e2c2ab5d9a6","observation_id":"d2c84141-fda2-44a5-bfc2-43702f3540a6","resolution":{"observed_at":"2026-08-06T20:38:54.332729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:02.649037Z","title":"Scal- ing up gans for text-to-image synthesis","venue":null,"work_id":"29f98a33-3e1f-4d1c-aded-bbfd5e711863","year":2023},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:54.441576Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:7c1e6841f255215bd68d80ccfcb965ceefbabcdd9e4422e008698dcf8fbbc09f","observation_id":"f0cf46fe-5814-49b2-9866-2f7da5f4680e","resolution":{"observed_at":"2026-08-06T20:39:02.737625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T20:38:54.576078Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:54.576078Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:6484585d7e5dc5851ce901973e4af53a68f48c9e85e601c5bc2f3a50661dfc0a","observation_id":"ea571856-f4ef-4846-aea3-f5a4519b682b","resolution":{"observed_at":"2026-08-06T20:38:54.576078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-06T20:38:54.639643Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:54.639643Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:0b7df3da3f934ab684b85a1445f276e1a4b9d921af98656634cbfbe9c50ef3b1","observation_id":"6133d91a-e062-42ed-9223-0c70b3434c7f","resolution":{"observed_at":"2026-08-06T20:38:54.639643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:02.495129Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":"35074aa8-5146-4e72-b20d-b1b1896de438","year":1956},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:54.771727Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:7b38f7120327f5ce188092fcbfd366a374eecbc100408ecbeffcde1aeea2804a","observation_id":"194bf243-bd23-4617-b4c0-cb48ff39a332","resolution":{"observed_at":"2026-08-06T20:39:02.560207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:02.294993Z","title":"Improved precision and recall met- ric for assessing generative models","venue":null,"work_id":"eda9a3ec-ca3a-48d6-b516-0064bedb954a","year":2019},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:54.860245Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:9e4d5127db767e4f50f7d18578f37a02d20523025464558873d63424fa9c2f76","observation_id":"e95f4f2a-e9be-40b6-96a6-bc5de225b262","resolution":{"observed_at":"2026-08-06T20:39:02.381655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:02.103281Z","title":"Autoregressive image generation using residual quantization","venue":null,"work_id":"5688ddd4-8f88-4bc7-aedb-39c0d2d09250","year":2022},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:54.984525Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:d955ebe67e269b0aadaefb8f70eb3ddf7ed8cca52181ff09ff88efffd45a278a","observation_id":"8f3074bb-2efe-4a84-bc4c-07648556f66e","resolution":{"observed_at":"2026-08-06T20:39:02.195683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-08-12T23:40:46.718337Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-06T20:38:55.067070Z","title":"Autoregressive image generation without vec- tor quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:55.067070Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:8eeca9894f505c8344da668886fa1c5300d741c4f3b948a3a3d237bb45d60726","observation_id":"11f53f2a-9ad8-48f1-b5bc-c20e4fc7800d","resolution":{"observed_at":"2026-08-06T20:38:55.067070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:01.885411Z","title":"Can ood object detectors learn from founda- tion models? In European Conference on Computer Vision, pages 213–231","venue":null,"work_id":"a34b213a-a15e-44f4-bde1-e5e51c36daeb","year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:55.189327Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:46000c10ce7306169eb4d95e1b9c7172a161531f9446384a14ad6ce4d189fe15","observation_id":"0e5809fd-d78d-4b70-be8e-134b593f4b10","resolution":{"observed_at":"2026-08-06T20:39:01.981059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-12T22:49:49.648733Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-06T20:38:55.296352Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual gener- ation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:55.296352Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:19e581dc08d9c9bd56d1acd19886749fdde73c8ef547fa0f8318c095fceadb6a","observation_id":"fcfe8a77-6e6f-4450-9185-deafc84b21d6","resolution":{"observed_at":"2026-08-06T20:38:55.296352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-06T20:38:55.373481Z","title":"Finite scalar quantization: Vq-vae made simple","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:55.373481Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:20439d9653ff5291029ad39deba623220b81502fe21d724d2f2948a103c6fe8f","observation_id":"8697f5c9-d9f9-4162-b67a-3a4eea8a129b","resolution":{"observed_at":"2026-08-06T20:38:55.373481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:01.692268Z","title":"Chatgpt, 2022","venue":null,"work_id":"819c9be5-3c16-4d72-8f98-8f0521c8f0ae","year":2022},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:55.485713Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:05966bfe8bd864a7a446bc1a0b046ac558088a38d9ece6ffe47c9dd8cdb3167a","observation_id":"84cfb75a-522f-4625-97cc-245a98ad51c1","resolution":{"observed_at":"2026-08-06T20:39:01.779476Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:55.572145Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:55.572145Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:376e3358c53381bfb8b6fca5612bc00668a65ca825de4e3f5accaf8d2923174a","observation_id":"8c5d375c-8c99-42c1-b5c6-8232315e88b9","resolution":{"observed_at":"2026-08-06T20:38:55.572145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T20:38:55.676762Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:55.676762Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:3cd8d8d7b5fb6e5428aab17a5c27f0bd0f0fe0e9b033d415a1df83b51368cbc3","observation_id":"f482462e-5fb0-44ca-a291-2cf43e445166","resolution":{"observed_at":"2026-08-06T20:38:55.676762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:01.483969Z","title":"Improving language understanding by gener- ative pre-training","venue":null,"work_id":"1ccfe290-1777-4105-9cee-e66d3c7bc3a0","year":2018},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:55.785083Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:e5e5ecdcf8a4ba37b8089a17d7d595bf2a0fe93162852aa9792d641e0e8f8828","observation_id":"c024bb86-250e-42fe-a37f-64b4dfd20df0","resolution":{"observed_at":"2026-08-06T20:39:01.566593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:55.863780Z","title":"Language models are unsu- pervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:55.863780Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:b9b5e382c1e97b35971596965f65cd92f3684fc8781080808756290ef640e7c5","observation_id":"90550810-4507-42c6-a770-02899ca4494b","resolution":{"observed_at":"2026-08-06T20:38:55.863780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:01.223146Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"dfd4d5df-dbaf-4f9d-ab83-29b4465a4c19","year":2021},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:55.940722Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:c3aa1ae90da800c080a307d428bd55a83d5d9de0fda9ed28662e843c3831cdfc","observation_id":"8b9b47ee-d9c0-4903-ba2e-f53a6e33b937","resolution":{"observed_at":"2026-08-06T20:39:01.390968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:01.035681Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"5c8ecd39-35a2-46f4-8ab5-7195e8adbbe0","year":2020},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:56.069853Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:7afa837325731974b5ea0baf011d668e4666f00a05cca2cd06bc81e0f78e4924","observation_id":"61f741a3-8025-4b0b-88b7-84bdd609e747","resolution":{"observed_at":"2026-08-06T20:39:01.119501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:56.131220Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:56.131220Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:1537f9d76eac4ee79183b66f19425b15565762d4a8c031d100b63d86e798d644","observation_id":"da487f64-e186-4b8c-8bc5-a8a5b7a4b60b","resolution":{"observed_at":"2026-08-06T20:38:56.131220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:00.843750Z","title":"Gener- ating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":"03e25894-e075-4405-a1fb-7f0098d34d02","year":2019},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:56.230436Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:2dd7f22f2c52398ea817aa45770cff5e9b10627aad07d2906b4e9dbfc68e0eec","observation_id":"596ddcf9-5829-46db-a754-a5a015f633fe","resolution":{"observed_at":"2026-08-06T20:39:00.945484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:00.630309Z","title":"Gener- ating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":"af041d81-a262-4b18-b1bc-99ef42f7b5ab","year":2019},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:56.318130Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:195c346caae10b33da54a6ee0a234b971efad3ff298720e4a9fa761fe551a9bf","observation_id":"1bd6eaa0-930d-478b-989c-6d5b7ce36292","resolution":{"observed_at":"2026-08-06T20:39:00.739219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:00.438182Z","title":"High-resolution image syn- thesis with latent diffusion models, 2021","venue":null,"work_id":"818a4c7a-cf8a-48a5-bb04-3a366420c918","year":2021},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:56.406666Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:23bf18659afa577ded9941931f15c923e6fa8e658b0cf76298a04161f79bc134","observation_id":"716eab44-9570-4f39-8a05-ff68bd8e2df2","resolution":{"observed_at":"2026-08-06T20:39:00.542257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:00.231427Z","title":"Improved techniques for training gans","venue":null,"work_id":"6153a407-5418-479f-b0d2-e54f60b627cc","year":2016},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:56.493251Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:ad8767e733600e873ebab896defd910b08a5a63f7a159ff6fae69998cc4a4b12","observation_id":"085de32d-4c83-431f-96b6-1d17a61a6e54","resolution":{"observed_at":"2026-08-06T20:39:00.300853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:00.048447Z","title":"Scaling stylegan to large diverse datasets","venue":null,"work_id":"d9fadf4b-5861-423a-a689-80a200724321","year":null},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:56.589420Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:c0ac91ae3b9a8d0a03b1669340a519caed2fb759477eb6f709112ef02a577141","observation_id":"5207939e-56c9-4e37-8936-00aa2188182d","resolution":{"observed_at":"2026-08-06T20:39:00.137125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T20:38:56.675293Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:56.675293Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:6360df855b0d5024d0c3d57395233e5282cf50ebf144dd84dcf45cb24ab26ce1","observation_id":"e4580822-a7f2-4966-b05a-8706305df4d9","resolution":{"observed_at":"2026-08-06T20:38:56.675293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:56.787379Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:56.787379Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:bb67a6412c32b92d1e3575cbfa08f60fdf66d1d75d133a26254b804702cf4f0a","observation_id":"cae115fe-7b40-4e33-ba1e-c0e49869ebf3","resolution":{"observed_at":"2026-08-06T20:38:56.787379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-12T17:57:54.262483Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-06T20:38:56.919368Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:56.919368Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:3baa7fab7953bb0dede15bbc60e6b93980d2c77d10c806ffc38838a960f3cb91","observation_id":"d123d1e1-29a5-4d51-9fb2-57ab8efe9b44","resolution":{"observed_at":"2026-08-06T20:38:56.919368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-08-13T06:27:06.478433Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T20:38:57.032639Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:57.032639Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:f9900fba3c4d0cdf8aba35cce8bbedfb2ad4d35dd9bebebca5eec350d4c5d311","observation_id":"0545d7ab-e8ab-4af0-aa92-0f0e0a056a55","resolution":{"observed_at":"2026-08-06T20:38:57.032639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T20:38:57.164384Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:57.164384Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:0fcecd42497aa468d8a6ee336a4f69237567572211931f4b47dacf85ec452c0a","observation_id":"f5f598eb-b3e3-4524-b662-14dcfddad4be","resolution":{"observed_at":"2026-08-06T20:38:57.164384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:59.816152Z","title":"Conditional image genera- tion with pixelcnn decoders","venue":null,"work_id":"a4e5bb5a-ac23-4e0e-b061-f2a703fdf5a1","year":2016},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:57.282355Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:058c4efd9fdab12181c8c8fbb5227b8ac596e4f56e977bac87ec02ad2fac3e68","observation_id":"36fb175c-1dd8-4393-9906-a66607c977e2","resolution":{"observed_at":"2026-08-06T20:38:59.941319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:59.612924Z","title":"Neural discrete representation learning","venue":null,"work_id":"77090269-681d-4cc0-9288-a23ff86ea0e0","year":2017},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:57.409657Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:eaafcd57342fba18eb194bdfe1e5c38e4fbc7ffe54dd11a3e8a8ff484ec6e341","observation_id":"34d65770-90a1-42b0-868e-139725bf6c31","resolution":{"observed_at":"2026-08-06T20:38:59.720741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:57.522886Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:57.522886Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:8806322e45ca512cbed7acded501983cbd9b336613f6f02ef5eeea3db86be449","observation_id":"c038c626-54e8-47ef-a726-6173a8b43b78","resolution":{"observed_at":"2026-08-06T20:38:57.522886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:59.407905Z","title":"Recon- structive visual instruction tuning","venue":null,"work_id":"4e30c0e5-bc26-43e1-ae21-94ce75a3caf3","year":2025},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:57.678701Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:36fc06679160fd040bab322120cb6d34d73b69fcc05d4d1a74c4558cb15f44a3","observation_id":"ea5a5c3b-0972-4db0-ab9a-265f5817e67e","resolution":{"observed_at":"2026-08-06T20:38:59.508204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-06T20:38:57.803144Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:57.803144Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:c590cbb0645c8e9cf9bedd33c71af8cbf75a8c9926ffb96981043eaa80e8b78a","observation_id":"0786b244-b449-42fc-9241-b9291128dd20","resolution":{"observed_at":"2026-08-06T20:38:57.803144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-08-13T12:11:58.325060Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-06T20:38:58.028490Z","title":"Vector-quantized image modeling with improved vqgan","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:58.028490Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:49daf108896ce4e9236aaa9c13b4c6c4bead66fb01e7b2d85372ade9e487d472","observation_id":"89feb30a-2973-4832-8d8c-fdecdfb6844b","resolution":{"observed_at":"2026-08-06T20:38:58.028490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-08-13T13:45:12.888881Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-06T20:38:58.143921Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:58.143921Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:7e1e145a839a1a5759c6dbf8fcc752f244452595df71a38e7073747447d4efdb","observation_id":"efce1fec-01bf-4eb8-b361-4439f5f9c537","resolution":{"observed_at":"2026-08-06T20:38:58.143921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:58.299612Z","title":"Magvit: Masked generative video transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:58.299612Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:3c7a6da43916ee0bb139703d337324aed8480eaf5683237aef32d68627d23855","observation_id":"fcfd4529-befd-47c1-a6ec-8b0119b5a0d2","resolution":{"observed_at":"2026-08-06T20:38:58.299612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-06T20:38:58.432446Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:58.432446Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:a6186e3f716d304e03163ba5147a43f1fb8a337baa564458832f28fe8b17d4fb","observation_id":"d1a0d0b0-9707-4e2b-8678-e2f9d0d1584b","resolution":{"observed_at":"2026-08-06T20:38:58.432446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07550","last_updated":"2024-06-11T17:59:56Z","snapshot_observed_at":"2026-08-12T23:45:15.377628Z","submitted_at":"2024-06-11T17:59:56Z","title":"An Image is Worth 32 Tokens for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07550","snapshot_observed_at":"2026-08-06T20:38:58.541916Z","title":"An image is worth 32 tokens for reconstruction and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:58.541916Z"},"links":{"cited_paper":"/paper/2406.07550","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:221efb11f73e716b8b7c2f5d3466d092f08486bf7b200ab86cadb4fd85c5ea2d","observation_id":"4b2fd8ff-3c60-4015-bbfc-aa3e9bcfd79f","resolution":{"observed_at":"2026-08-06T20:38:58.541916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:58.654597Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:58.654597Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:baafe0ad5980715b55891866a319c4c80edb5cc3d25740372224aa59a0d4b678","observation_id":"712c362b-dd7b-4bea-9a69-564876f8923d","resolution":{"observed_at":"2026-08-06T20:38:58.654597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-06T20:38:58.785878Z","title":"Opt: Open pre-trained trans- former language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:58.785878Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:009a555fd8352847bd2d66bdd6d887ab1e98b1ca8c966a9655f9904f08022385","observation_id":"05fc0137-ac8e-43b0-a1ef-80a6319e9a43","resolution":{"observed_at":"2026-08-06T20:38:58.785878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:58.888409Z","title":"Movq: Modulating quantized vectors for high- fidelity image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:58.888409Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:f38b4d5e70f4eae537fd5e7bcb96fe3bc9a67710832a1455dffc516aa48fd5c0","observation_id":"ed2c56b1-8b6e-4b80-9ec4-5b1d9e66cd5e","resolution":{"observed_at":"2026-08-06T20:38:58.888409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11837","last_updated":"2024-06-17T17:59:57Z","snapshot_observed_at":"2026-08-12T23:40:45.834749Z","submitted_at":"2024-06-17T17:59:57Z","title":"Scaling the Codebook Size of VQGAN to 100,000 with a Utilization Rate of 99%","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11837","snapshot_observed_at":"2026-08-06T20:38:59.016813Z","title":"Scaling the codebook size of vqgan to 100,000 with a utilization rate of 99%","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:59.016813Z"},"links":{"cited_paper":"/paper/2406.11837","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:ae8f986817cc22985cbf3f3d53b26d783a3972288381742bf47eed662dc08a69","observation_id":"3c5cddd5-da6d-4fec-a0e4-672898b727ba","resolution":{"observed_at":"2026-08-06T20:38:59.016813Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":2,"unresolved":34,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 6 inbound Pith citation observations for arXiv:2507.02358."}