{"as_of":"2026-08-14T14:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b51dbb7e2421c77ac530d3d192192ad669a319917eb9665c57af1de4de2afbd","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T08:00:16.005187Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.30317/citation-record","integrity":"/paper/2605.30317/integrity","json":"/paper/2605.30317/citation-record.json","paper":"/paper/2605.30317"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:46ecda525f3b1312ca299f28569cf476e7f6e3f3ccb106b1cb03b8d426b1d01e","observation_id":"ed3b6c15-2b04-4260-bcac-4123f1d00003","resolution":{"observed_at":"2026-06-29T08:03:14.053299Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Self-rectifying diffusion sampling with perturbed-attention guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:3321c1763f42d54cbef58ead972c8bed833fd67a262cab505771ac87cc63ea69","observation_id":"93b16958-4035-4284-ab1a-64a6bcaf27dc","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.findings-acl.58","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Findings of the Association for Computational Linguistics: ACL 2022 , publisher =","venue":"Findings of the Association for Computational Linguistics: ACL 2022","work_id":"534c14af-b9fe-4e9e-8bfb-de2678293eec","year":2022},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:0976ea15a4da5f7b9a2bb36ebf413f9c24c4c15c293d8234a8d52d1cade50d94","observation_id":"3f27767c-42e8-4eea-8fd4-6c305beda22c","resolution":{"observed_at":"2026-06-29T08:03:13.618766Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Scheduled sampling for sequence prediction with recurrent neural networks.Advances in Neural Information Processing Systems, 28, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:9db59d69e176f502a08ab2526acd78c0b093552a52b439e03d70da5e74a50359","observation_id":"95dc5809-f98c-4ea4-993c-0d9e3324bd7a","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Generative pretraining from pixels","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:3369c80d695f5f734b2de1b912c74852ab1d7dceae4552287982df850677d14c","observation_id":"98c96b3d-7a37-4884-8ca2-439d4a4de3a6","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-14T10:06:18.357222Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:5ac2e08af7fc43a9ad36306ca6743a86a59365bef1b110ece82abb3a119e85bf","observation_id":"6b471dcf-9997-4c40-9171-3ea36359ac57","resolution":{"observed_at":"2026-06-29T08:03:14.050583Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:8f7acc4de479043cc5dcb565aaa23be5af321fcf1578acdb1d92c009af555306","observation_id":"a4c74d2e-963c-48bc-b7c8-d6cbfe9d16d4","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:9809b2ea30286fd3d0d3309b73f287e26bd97caf050cdbebae5096a36224db9f","observation_id":"400e1312-d99b-42a3-86e5-8dd993ef4428","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment.Advances in Neural Information Processing Systems, 36:52132–52152, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:f5def73cd926328068b9ace24081feaac2f5cf3ac1b163364ce37286aee158ce","observation_id":"73b74f10-6c50-46b8-abab-0853bdd662b1","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Deep autoregressive networks","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:9771da7696305338777f58d2aa5a7475782ab76745e5ec59c9b607d9a6047cf3","observation_id":"0b7a5381-863c-4e21-8f0c-aa7c8c0a3322","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Suboptimal behavior of bayes and mdl in classification under misspecification.Machine Learning, 66(2):119–149, 2007","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:5479afb3a0f1cb628f202e54f02a9407cdd9e406f60b9535003a0527c29aba92","observation_id":"0e3b39a0-77ec-48da-a31f-42593d997426","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:088864a7abcfc59d8c3005dee4427457b4fefd71a6f54967bd8a659387565484","observation_id":"31124dfc-aa24-450a-b2dd-c8e59e2e13a3","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06568","last_updated":"2025-03-09T11:54:08Z","snapshot_observed_at":"2026-08-07T17:19:06.908792Z","submitted_at":"2025-03-09T11:54:08Z","title":"Conceptrol: Concept Control of Zero-shot Personalized Image Generation","version":1},"cited_work":{"arxiv_id":"2503.06568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.06568","snapshot_observed_at":"2026-07-02T03:26:29.461039Z","title":"Conceptrol: Concept control of zero-shot personalized image generation","venue":null,"work_id":"19d097e3-81f8-454a-9543-e3eee51e7450","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2503.06568","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:ea63a97ed8e9cf6d6ae2416d732998741c3eb73a90f194e48e75d0fcf867a44c","observation_id":"a3df8ecd-32d0-4cc0-ba45-436ff05cbab3","resolution":{"observed_at":"2026-06-29T08:03:14.006326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17924","last_updated":"2024-10-04T17:09:40Z","snapshot_observed_at":"2026-08-13T11:06:54.474032Z","submitted_at":"2024-03-26T17:57:05Z","title":"AID: Attention Interpolation of Text-to-Image Diffusion","version":3},"cited_work":{"arxiv_id":"2403.17924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17924","snapshot_observed_at":"2026-06-29T08:03:14.039667Z","title":"Aid: Attention interpolation of text-to-image diffusion","venue":null,"work_id":"09217a78-35cb-420d-9409-5d97ea152c25","year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2403.17924","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:4b478695cfbf25e1f71f680a59e4d46cfa1c2b330656364fe95d3c2bb10d4aaf","observation_id":"f607d092-18b6-4404-b2c6-6e747271918c","resolution":{"observed_at":"2026-06-29T08:03:14.041712Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.04450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:03:13.990478Z","title":"REAR: Rethinking visual autoregressive models via generator-tokenizer consistency regularization.arXiv preprint arXiv:2510.04450, 2025","venue":null,"work_id":"ce1e2487-1340-4331-8dfb-037f67a408fb","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:b69cfbe66725bc017467afba924dd28d8e6eb6d9bd69fc83514c6ca2fb95e8a2","observation_id":"9083b459-91cf-404e-9352-98adfe80ea31","resolution":{"observed_at":"2026-06-29T08:03:13.991902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:a52110d508326a08134bd724df44d7ec2d8b7df29e30d233bf24359cbe4f4235","observation_id":"75051b49-dd15-4a8d-92f0-1338ca6f9fb7","resolution":{"observed_at":"2026-06-29T08:03:14.003382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Smoothed energy guidance: Guiding diffusion models with reduced energy curvature of attention.Advances in Neural Information Processing Systems, 37:66743–66772, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:bde68dfbcd53ae4cedad493947497826cd95fce093c2dcb3a042fc94f228a5bb","observation_id":"cbf2529d-be3f-4743-9b91-f1f78e4566c5","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":"2403.05135","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-07-04T16:59:58.040795Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","venue":"cs.CV","work_id":"94248955-4bc5-4517-98a0-66224a36d865","year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:57e9a7e0ae4da46308ae22172f02773d2fd58d0fb4071a8e152b439d9ac9287d","observation_id":"6057887a-a83a-4bf6-be73-32b9d480e92b","resolution":{"observed_at":"2026-06-29T08:03:14.026465Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":"2506.08009","doi":"10.48550/arxiv.2506.08009","metadata_source":"pith","pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","venue":"cs.CV","work_id":"53e58ef9-7932-4b83-b757-34ac14db3e0f","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:e3581d49ad56bfff273cb35490dc1ba796c7b07f27d469da857939d8214558a7","observation_id":"2c046fa5-3350-4f41-b1e6-556a71750e6f","resolution":{"observed_at":"2026-06-29T08:03:13.986844Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:4be127dbde10108ce98196364fee522cfb7f545c7c55b43d7512ec64a1c317a4","observation_id":"07eb17f9-7820-462b-b61b-488dff237447","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Guiding a diffusion model with a bad version of itself","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:9553f6b49a3ba22f6804432e7f00643ddd0d78fff071257069c36a7b14f96dff","observation_id":"c6c66a4c-7d7d-4b70-b362-002311b3800d","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:65638d143d3daac666aeb30c3ca19412d708df5b05febb24a7f26b292f7d2fa3","observation_id":"bef1f905-a5e6-4dca-8756-6ba81abe32d8","resolution":{"observed_at":"2026-06-29T08:03:14.000811Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"FLUX.2: Frontier Visual Intelligence.https://bfl.ai/blog/flux-2, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:23462a009f7a0d3ed0b7c4cf4993a331c440a4761862c4278d42074491fdafe2","observation_id":"2c2eadf8-e9c0-40ae-b4fe-2014487d94d9","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Lamb, Anirudh Goyal, Ying Zhang, Saizheng Zhang, Aaron C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:a0e0768994781eb3a81fdf53b4fa252f6202863bd606166f7f8bb5c73e4d804b","observation_id":"5d139193-acd6-4058-8e74-0999205b0ab0","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Autoregressive image generation without vector quantization.Advances in Neural Information Processing Systems, 37:56424–56445, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:8af36beb30d60bfbb781402529d7a5362ebbf00b4c1471fc7384c23def0b0d82","observation_id":"a4e4e4e6-d8eb-4a08-8fc3-28f786052ca0","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.19680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T18:35:00.312631Z","title":"arXiv:2512.19680 (2025) 5","venue":null,"work_id":"1ba4d47f-36db-4a3c-b1f7-857c48fb76cb","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:933dd4751f14880718eb6487dd90a209ed50f75a3205d41fdcd7a8dba4dcbc8f","observation_id":"8a83ec89-a026-414e-8ce8-b7400950421a","resolution":{"observed_at":"2026-06-29T08:03:14.044788Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"cited_work":{"arxiv_id":"2505.19196","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19196","snapshot_observed_at":"2026-06-29T08:03:13.983158Z","title":"Step-level reward for free in rl-based t2i diffusion model fine-tuning","venue":null,"work_id":"cf021125-1fd3-49b4-9144-9fefbe53e155","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2505.19196","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:b40d149c452bb14d3ce92b05435c1fc3c8a73fcb3e2bb4e537cb54964e38230f","observation_id":"e2f44700-b3bf-4fee-b294-a22df8a5e414","resolution":{"observed_at":"2026-06-29T08:03:13.984555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.04675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:58:32.625805Z","title":"Infini- tystar: Unified spacetime autoregressive modeling for visual generation","venue":null,"work_id":"e3d06309-1944-454b-be20-f4ffef259bf7","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:b22c7a68487060b8ef6f8a16a0ed17b471a9a70b17bdf229c881e9ed2dafe51e","observation_id":"3e2fce92-ecd4-4df1-ace6-002cd328c80c","resolution":{"observed_at":"2026-06-29T08:03:13.998565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Interp3d: Correspondence-aware interpolation for generative textured 3d morphing","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:2655c452399426ef7e3d6db735e5529f58675d3a07494986852c26f178c2679e","observation_id":"4db29d96-217c-45f7-a594-85352b5f3947","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.20321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:09:50.827602Z","title":"Unitok: A unified tokenizer for visual generation and understanding.arXiv preprint arXiv:2502.20321, 2025a","venue":null,"work_id":"31d5c278-398d-4fee-8130-a864fb6b3717","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:d6b3a48177a801eef51e3cd20bf216046d36d8c367dcbdaa873a271c4c552eea","observation_id":"90e4471b-9750-40f8-a803-89c407d567c9","resolution":{"observed_at":"2026-06-29T08:03:14.038473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":"2309.15505","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-07-10T02:16:42.481403Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","venue":"cs.CV","work_id":"34dd22bc-0de9-4e11-9a1b-1358e10fbfe1","year":2023},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:250b5972d9c0e25363f4e67c7ff1a5ec6fb86f799a982631a37eb90cf77f74bc","observation_id":"b4fce583-aa95-4a38-ac42-7b53996283d3","resolution":{"observed_at":"2026-06-29T08:03:14.035462Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Image transformer","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:fba6a83221894c70d062c14e5b220b626023519ee6724cb243d6cb507b3843a6","observation_id":"18777129-4c80-40b6-aa14-d1d680a1f58b","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20388","last_updated":"2025-03-20T18:15:30Z","snapshot_observed_at":"2026-08-09T06:15:55.650722Z","submitted_at":"2025-02-27T18:59:08Z","title":"Beyond Next-Token: Next-X Prediction for Autoregressive Visual Generation","version":2},"cited_work":{"arxiv_id":"2502.20388","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20388","snapshot_observed_at":"2026-07-04T20:50:11.364862Z","title":"Beyond next-token: Next-x prediction for autoregressive visual generation","venue":null,"work_id":"0e9ba908-c13e-44d1-993a-2ce2994b1cc9","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2502.20388","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:47bfe4910e2c71522f786eda54227880314d2462647f3c3a7c5442ea72dacd15","observation_id":"2ef82b06-ad04-43e7-b1e7-e8bf54ea51ba","resolution":{"observed_at":"2026-06-29T08:03:14.032693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:9469ede2dfd02e40c1c510d9895c7cb8c8c1665bffadf7db6425b68356ef98eb","observation_id":"2e13bba3-f311-43e2-b66f-5e8e7ace93e9","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d19-5616","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generalization in generation: A closer look at exposure bias","venue":null,"work_id":"9e839924-f946-480e-98b2-a0510caf04eb","year":2019},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:fd078d05913517cee5fbe069ca3d5085074e394900e489a404c81824b0ad02ea","observation_id":"1b532297-0cc7-4230-9e72-7bd436286f91","resolution":{"observed_at":"2026-06-29T08:03:13.622848Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"SSG: Scaled spatial guidance for multi-scale visual autoregressive generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:0dba7d616ad34c107a08a9d5a66764ca4781c6645dcdab6d68a9d7d274e2359c","observation_id":"a0dab1f5-8885-4b0c-985f-dad850f4a79d","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":"2406.06525","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-07-10T11:37:03.266757Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","venue":"cs.CV","work_id":"41efe203-9377-4c63-b1d6-e499cd6e46f6","year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:a95d8d8837abb9d36c6ebfaa86bd2cf94251dfd3b852da25ba103569d17a7d79","observation_id":"6fea1418-0209-443c-9c0b-52757ead38d6","resolution":{"observed_at":"2026-06-29T08:03:14.020689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:b881700900ef23af86ad1d63adaaa1d599b3a57be33f24bd19a173f759298b00","observation_id":"4991b45d-f9ca-4900-a43a-82df66351c11","resolution":{"observed_at":"2026-06-29T08:03:14.011397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:aecd229df7ca4a3780944dac3fe1b45a22e18c77011352a8baa923130610e241","observation_id":"fa2401a5-0ed9-4ae7-a9aa-c4162a9fbe12","resolution":{"observed_at":"2026-06-29T08:03:14.005561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.Advances in neural information processing systems, 37:84839–84865, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:ff7d64a7207530dc616817eba067822e6e298346c49822b587bb920182b283bc","observation_id":"c0a7076f-c789-4122-9f2e-e96ed35b0d93","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Neural discrete representation learning.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:67984e58ab9c4909e9c4347c2433044361ed64c93ec2278f86468b28f142d3a7","observation_id":"6c1dd962-3c73-45f3-80bc-6ef55b7e4142","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:a9db8e222d7b590d23ab707eec92c823ddcd8bc8e5519aeac4948aebd8747893","observation_id":"1151c0a7-cda7-4d45-8b4e-cc39787496fb","resolution":{"observed_at":"2026-06-29T08:03:14.029311Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03642","last_updated":"2020-05-07T17:46:02Z","snapshot_observed_at":"2026-08-10T11:54:04.771665Z","submitted_at":"2020-05-07T17:46:02Z","title":"On Exposure Bias, Hallucination and Domain Shift in Neural Machine Translation","version":1},"cited_work":{"arxiv_id":"2005.03642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.03642","snapshot_observed_at":"2026-06-29T08:03:14.045889Z","title":"arXiv preprint arXiv:2005.03642 , year=","venue":null,"work_id":"86ea5fa8-a5e5-446c-a5b5-25d611f5d40f","year":2005},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2005.03642","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:40f586b943a7e5c8aca0050d9b1bbfe0cbcc411a5f6be3b4674634d89cd60d24","observation_id":"8c1d0f35-8b15-4af2-8133-d6d0c427f24b","resolution":{"observed_at":"2026-06-29T08:03:14.047424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Blaschko","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:0379d427329d67becb8bd84a050f5cb9d9caefe122e380f74e53bcfd93481412","observation_id":"0ed9c76e-7e73-46df-9462-2063178dcb34","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:b07878bfdde166bb9e8edf4dc057f97279702be1f539bb00bc44d3bcee3dbf10","observation_id":"c7df9d30-7ee3-4de0-a9a7-7c3d1b2aa685","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16975","doi":"10.48550/arxiv.2512.16975","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Infotok: Adaptive discrete video tokenizer via information- theoretic compression","venue":"Open MIND","work_id":"a75f190f-a25f-4878-aedf-4e795b41cc37","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:34d58594a8dba07021ebdc0db8739ed3311e8ad64fa162658495b260a4282b63","observation_id":"72d0987f-c2ca-4c5e-a5a5-0a17ef30a38b","resolution":{"observed_at":"2026-06-29T08:03:14.024593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:8aec4d1dc18d3d31887ef43ba39cd6d866814f275d3c032346a059bbf7603960","observation_id":"601e44bc-c052-4d4b-89f9-e011dd6a7e21","resolution":{"observed_at":"2026-06-29T08:03:14.019333Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"An image is worth 32 tokens for reconstruction and generation.Advances in Neural Information Processing Systems, 37:128940–128966, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:21aaa3c92db82bdb1f29f05118b3c89d8560a59bd6d986ab4bf7bf6c72677e22","observation_id":"d2b5d881-b1e2-413b-b412-6f87a6623a31","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08048","last_updated":"2026-04-09T09:54:49Z","snapshot_observed_at":"2026-08-11T06:54:24.418344Z","submitted_at":"2026-04-09T09:54:49Z","title":"Guiding a Diffusion Model by Swapping Its Tokens","version":1},"cited_work":{"arxiv_id":"2604.08048","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08048","snapshot_observed_at":"2026-06-29T08:03:14.022321Z","title":"Guiding a Diffusion Model by Swapping Its Tokens","venue":"cs.CV","work_id":"abe04f08-4af9-427c-9a2e-0e25961c86aa","year":2026},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2604.08048","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:4a85391e8612cf86c7879048f77edb88e3cfe6dd42f6074cb6b47ce5bd1f70fc","observation_id":"f6202b98-316e-46fa-b1a7-5f1084975064","resolution":{"observed_at":"2026-06-29T08:03:14.023553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p19-1426","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"author Feng, Y","venue":null,"work_id":"08b4a008-6559-49d2-a88f-e50a9fe3771b","year":2019},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:ee4d4260787082d5892c4c4dc11560b99590b0d65ebbeb0ee5cffdef674b2294","observation_id":"02c37d58-e6fb-466a-b1e0-f19f5d5dcb95","resolution":{"observed_at":"2026-06-29T08:03:13.620657Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07548","last_updated":"2024-06-11T17:59:53Z","snapshot_observed_at":"2026-08-14T02:44:15.496372Z","submitted_at":"2024-06-11T17:59:53Z","title":"Image and Video Tokenization with Binary Spherical Quantization","version":1},"cited_work":{"arxiv_id":"2406.07548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.07548","snapshot_observed_at":"2026-07-04T19:30:07.369173Z","title":"Image and video tokenization with binary spherical quantization","venue":null,"work_id":"68f42337-bf16-4e4c-857e-ed48861a3968","year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2406.07548","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:bd5c802cb37fba04cd4c6656fde7687caf0b93a527e040c0a3de48406bd7fcbe","observation_id":"5195f449-27e6-47ae-aa2a-7076b077e4c8","resolution":{"observed_at":"2026-06-29T08:03:14.008832Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05425","last_updated":"2026-05-27T15:11:58Z","snapshot_observed_at":"2026-08-14T12:35:25.215025Z","submitted_at":"2026-03-05T17:45:47Z","title":"RelaxFlow: Text-Driven Amodal 3D Generation","version":2},"cited_work":{"arxiv_id":"2603.05425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.05425","snapshot_observed_at":"2026-06-29T08:03:14.016496Z","title":"RelaxFlow: Text-Driven Amodal 3D Generation","venue":"cs.CV","work_id":"8d28c49b-c246-45be-8031-1dba9be124d7","year":2026},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2603.05425","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:314f1dd42c877d5176a478e3ab141994218576fa1d481d051825308d939d0b29","observation_id":"14e6710d-d70c-4bd7-a6ca-16c18b370ed5","resolution":{"observed_at":"2026-06-29T08:03:14.017742Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T03:35:22.379359Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":24,"verified_exact":25,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2605.30317."}