{"as_of":"2026-08-11T01:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2122734dab4fbb4e03946c43f45bc0c618be427d87034c7c0c9134899711afc8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":78,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:21:49.117719Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":7,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T22:09:16.622717Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2406.06525"},"observation_digest":"sha256:75e1d000921fcff3d291bb87c2234e44d83902f5a8bf338eb19e781aa51a16ab","observation_id":"d91e267a-b3a2-4d8c-8cf8-9ca90a95bf04","resolution":{"observed_at":"2026-05-11T22:09:17.082429Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-15T22:09:16.001309Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2410.13848"},"observation_digest":"sha256:d2eac18b0b74fbf1e89c27abe5404b8617354b7f62e7ee5d7851e7c8f3d96b85","observation_id":"aa59adfe-778c-44d2-9b3f-206b7dbd019e","resolution":{"observed_at":"2026-05-15T22:09:16.295516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:874bf340172849222f987003c8a9a90d1019d5e3f3bccb1a13c8a42badf8f956","observation_id":"1c6270e0-1e58-47e8-9950-89e91be7415e","resolution":{"observed_at":"2026-05-17T15:07:39.912883Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-11T00:21:49.117719Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19505","last_updated":"2024-12-30T09:08:12Z","snapshot_observed_at":"2026-08-11T00:14:18.899704Z","submitted_at":"2024-12-27T07:44:07Z","title":"DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:49.117719Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2412.19505"},"observation_digest":"sha256:561e51f90d5a2f64c04bfb6150274f12c73b018b461cbc8d07347563d55a1d59","observation_id":"441621c2-8bf1-4738-869a-8cfc14e27081","resolution":{"observed_at":"2026-08-11T00:21:49.117719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-10T23:09:05.655315Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21063","last_updated":"2025-04-13T03:11:43Z","snapshot_observed_at":"2026-08-10T23:01:07.556269Z","submitted_at":"2024-12-30T16:32:55Z","title":"Navigating Image Restoration with VAR's Distribution Alignment Prior","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T23:09:05.655315Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2412.21063"},"observation_digest":"sha256:de623b84bcc416757d0b6b2f0bdcd6592a56b7c5acfd60c400dc892b73cc3dc4","observation_id":"b84fcc20-4e37-4496-b593-9a08e5d4cd40","resolution":{"observed_at":"2026-08-10T23:09:05.655315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-10T23:02:07.890346Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-10T22:52:06.844699Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:07.890346Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2501.00289"},"observation_digest":"sha256:6eb4db43d1793e3b476e2c1155f86949b332066546c09daa5fabaf90dd26f77c","observation_id":"7a85e97e-667e-4a98-aeff-3fc37818342f","resolution":{"observed_at":"2026-08-10T23:02:07.890346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-10T22:44:30.556702Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00895","last_updated":"2025-03-20T13:03:26Z","snapshot_observed_at":"2026-08-10T22:37:59.534582Z","submitted_at":"2025-01-01T16:56:43Z","title":"Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.556702Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2501.00895"},"observation_digest":"sha256:1c64b73c9421b00028cf422d9bdef9d49e7aa01a65f5df0ea015bb7957bf6406","observation_id":"915d1d9d-09d5-4885-ada2-261af54cf9fd","resolution":{"observed_at":"2026-08-10T22:44:30.556702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-10T22:34:14.502818Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01423","last_updated":"2025-03-10T11:43:42Z","snapshot_observed_at":"2026-08-11T01:06:46.210110Z","submitted_at":"2025-01-02T18:59:40Z","title":"Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:14.502818Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2501.01423"},"observation_digest":"sha256:785d8c0178195dda2dff09c7d21c7a24c926d116c7d2e7fc3748f1a4ece7490f","observation_id":"f47b1b30-6003-4a8f-a8a0-7fdab5631a8e","resolution":{"observed_at":"2026-08-10T22:34:14.502818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-10T21:42:46.324458Z","title":"Visual au- toregressive modeling: Scalable image generation via next -scale prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04299","last_updated":"2025-01-08T06:07:33Z","snapshot_observed_at":"2026-08-10T21:52:25.929392Z","submitted_at":"2025-01-08T06:07:33Z","title":"Circuit Complexity Bounds for Visual Autoregressive Model","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:46.324458Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2501.04299"},"observation_digest":"sha256:775ab56ae95a9ab2bf7c88f9c8c32e4baa139a0071d8a5c2a71f94e5bad7501d","observation_id":"bcc2eb29-f6ed-484c-926c-e788d414ae82","resolution":{"observed_at":"2026-08-10T21:42:46.324458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-10T21:42:28.266132Z","title":"Visual au- toregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04377","last_updated":"2025-02-02T23:48:36Z","snapshot_observed_at":"2026-08-10T21:52:28.119513Z","submitted_at":"2025-01-08T09:34:15Z","title":"On Computational Limits and Provably Efficient Criteria of Visual Autoregressive Models: A Fine-Grained Complexity Analysis","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:28.266132Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2501.04377"},"observation_digest":"sha256:e2616c9f7b344d1f6c8ec9e757995a83e4f3a2ba2d60e1a589ce77c6551096c1","observation_id":"ccdfae70-fb8f-44f0-9658-321d3fa14f15","resolution":{"observed_at":"2026-08-10T21:42:28.266132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-10T21:29:20.097760Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04699","last_updated":"2025-01-08T18:59:35Z","snapshot_observed_at":"2026-08-10T21:57:36.732361Z","submitted_at":"2025-01-08T18:59:35Z","title":"EditAR: Unified Conditional Generation with Autoregressive Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T21:29:20.097760Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2501.04699"},"observation_digest":"sha256:da27b5539384bd32aaec19d5cf38f9df496444c61ed27496c4fbe344da4243de","observation_id":"24af7f36-0c71-4950-935d-3ccd57f542f6","resolution":{"observed_at":"2026-08-10T21:29:20.097760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-10T22:04:24.300681Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06218","last_updated":"2025-01-06T14:23:07Z","snapshot_observed_at":"2026-08-10T22:16:05.897874Z","submitted_at":"2025-01-06T14:23:07Z","title":"Dissecting Bit-Level Scaling Laws in Quantizing Vision Generative Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:04:24.300681Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2501.06218"},"observation_digest":"sha256:a57c0c92c1334aedb0114f819f4ff560134cd2a55801e6bbd752cb717aff8db3","observation_id":"2e0629b6-c86a-4d3a-97e6-3e1099613780","resolution":{"observed_at":"2026-08-10T22:04:24.300681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-10T20:42:45.198368Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07563","last_updated":"2025-01-13T18:53:08Z","snapshot_observed_at":"2026-08-10T20:36:14.691441Z","submitted_at":"2025-01-13T18:53:08Z","title":"Training-Free Motion-Guided Video Generation with Enhanced Temporal Consistency Using Motion Consistency Loss","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:45.198368Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2501.07563"},"observation_digest":"sha256:224e6e73af6aeccc16ca7dd254dd539dfb61af220231e509bc78cd033b032060","observation_id":"3845cba0-39c1-4fbf-a570-ee453f77a4e6","resolution":{"observed_at":"2026-08-10T20:42:45.198368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-10T18:52:59.948606Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10928","last_updated":"2025-04-19T14:52:08Z","snapshot_observed_at":"2026-08-10T18:47:01.186615Z","submitted_at":"2025-01-19T03:19:47Z","title":"Generative Physical AI in Vision: A Survey","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T18:52:59.948606Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2501.10928"},"observation_digest":"sha256:d26ebcadf1421a3455ee43a5fe3c208b9db40d31eb8a07e241cf63af311df8e8","observation_id":"7176b95c-3f60-43a9-ba2d-d564c4a4a679","resolution":{"observed_at":"2026-08-10T18:52:59.948606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-10T17:41:47.675826Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12012","last_updated":"2025-02-06T16:18:09Z","snapshot_observed_at":"2026-08-10T17:34:15.595189Z","submitted_at":"2025-01-21T10:06:19Z","title":"TabularARGN: A Flexible and Efficient Auto-Regressive Framework for Generating High-Fidelity Synthetic Data","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T17:41:47.675826Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2501.12012"},"observation_digest":"sha256:9a15ffbbe1b4f93c0571ffe3feb77f160705de40f493c49af7977ebb21541182","observation_id":"b77bf050-2abb-404e-9945-979adc048d63","resolution":{"observed_at":"2026-08-10T17:41:47.675826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-10T14:26:21.984665Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15420","last_updated":"2025-08-25T05:05:49Z","snapshot_observed_at":"2026-08-10T14:16:29.138482Z","submitted_at":"2025-01-26T06:48:05Z","title":"Visual Generation Without Guidance","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T14:26:21.984665Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2501.15420"},"observation_digest":"sha256:52c1d99ef8ffe6001b6cb3760e11b126dbd773e1e5853f5bb311a3fd2b041ed3","observation_id":"9d85fcf9-2d11-4099-8cc4-8473842895a5","resolution":{"observed_at":"2026-08-10T14:26:21.984665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-10T14:09:40.517503Z","title":"Visual autoregressive modeling: Scalable image gen- eration via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15619","last_updated":"2025-01-26T17:56:11Z","snapshot_observed_at":"2026-08-10T14:04:01.737031Z","submitted_at":"2025-01-26T17:56:11Z","title":"GaussianToken: An Effective Image Tokenizer with 2D Gaussian Splatting","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T14:09:40.517503Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2501.15619"},"observation_digest":"sha256:1bee6a31ef8872256b069571eafd160306d2f6561619bbe7602a9db0ef7eda1d","observation_id":"20d6dbe1-07ce-48db-93bc-6a0a56f341ba","resolution":{"observed_at":"2026-08-10T14:09:40.517503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-09T22:13:22.783271Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18871","last_updated":"2025-01-31T03:47:22Z","snapshot_observed_at":"2026-08-10T21:16:02.838892Z","submitted_at":"2025-01-31T03:47:22Z","title":"Neural SDEs as a Unified Approach to Continuous-Domain Sequence Modeling","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:22.783271Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2501.18871"},"observation_digest":"sha256:f4b825e370f137afb1913472bdba58616c5dc15e0c325030b947d9cd85707c2c","observation_id":"05b2ebf4-0839-462c-aeb9-a1ad5edb4a7b","resolution":{"observed_at":"2026-08-09T22:13:22.783271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-09T21:55:52.844188Z","title":"Visual autore- gressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18972","last_updated":"2025-04-30T03:02:41Z","snapshot_observed_at":"2026-08-09T22:31:57.339880Z","submitted_at":"2025-01-31T09:07:56Z","title":"BCAT: A Block Causal Transformer for PDE Foundation Models for Fluid Dynamics","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T21:55:52.844188Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2501.18972"},"observation_digest":"sha256:84f23d26f683652b594420f2703b67702e370b0165a1783aa30ab6b2a48a2364","observation_id":"cb9adb02-a286-4f34-bbbc-87d51055f4d2","resolution":{"observed_at":"2026-08-09T21:55:52.844188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-09T19:22:41.723340Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00359","last_updated":"2025-02-01T07:42:12Z","snapshot_observed_at":"2026-08-10T10:14:26.773878Z","submitted_at":"2025-02-01T07:42:12Z","title":"Exploring Representation-Aligned Latent Space for Better Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T19:22:41.723340Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2502.00359"},"observation_digest":"sha256:de75505e56bd865161caf15140e62cd83325a592c48daa4870c41069bf4cf520","observation_id":"c67b4aee-f6e5-4bd8-b5a9-42e83c91cf93","resolution":{"observed_at":"2026-08-09T19:22:41.723340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-09T19:21:56.314619Z","title":"org/abs/2404.02905","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00382","last_updated":"2025-02-01T09:41:01Z","snapshot_observed_at":"2026-08-09T21:47:44.085629Z","submitted_at":"2025-02-01T09:41:01Z","title":"Masked Generative Nested Transformers with Decode Time Scaling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:56.314619Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2502.00382"},"observation_digest":"sha256:91b5ced6b27fdaf8ce1d88b10ae881f162551c22f09eb55718ffd1c12ede29bc","observation_id":"8ce0bac2-8815-414b-bf85-14295f45dd79","resolution":{"observed_at":"2026-08-09T19:21:56.314619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-09T18:51:12.652631Z","title":"Visual autore- gressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00500","last_updated":"2025-02-04T15:19:12Z","snapshot_observed_at":"2026-08-10T02:49:33.781140Z","submitted_at":"2025-02-01T17:40:11Z","title":"Video Latent Flow Matching: Optimal Polynomial Projections for Video Interpolation and Extrapolation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-09T18:51:12.652631Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2502.00500"},"observation_digest":"sha256:e9e9df1f01e7ba1c30081e20a3cbbd0c3e01459d92578a00915a64f4fc27e355","observation_id":"696a1ae1-0d7b-4aaa-8bd2-763aabcea349","resolution":{"observed_at":"2026-08-09T18:51:12.652631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-09T04:47:30.420636Z","title":"org/abs/2404.02905","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03444","last_updated":"2025-05-30T05:49:31Z","snapshot_observed_at":"2026-08-09T04:41:07.556668Z","submitted_at":"2025-02-05T18:42:04Z","title":"Masked Autoencoders Are Effective Tokenizers for Diffusion Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T04:47:30.420636Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2502.03444"},"observation_digest":"sha256:dfb95cead5c680e180ccc6d62d414f361c2d5eaa75ce97d9f8f45fdf99167eea","observation_id":"0042ac06-01d5-435c-9301-8887c412a26f","resolution":{"observed_at":"2026-08-09T04:47:30.420636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-08T22:55:57.854361Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-10T18:19:21.964565Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.854361Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:fbb3948859bbfd2a31efd9cf6d614d9acab7209c22f2b6b5f8e7deef2c88b159","observation_id":"08783b4e-8ccb-4b41-aca8-4fc9536a8368","resolution":{"observed_at":"2026-08-08T22:55:57.854361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-08T21:50:24.564484Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04725","last_updated":"2025-02-07T07:49:37Z","snapshot_observed_at":"2026-08-11T00:21:39.601042Z","submitted_at":"2025-02-07T07:49:37Z","title":"Can Diffusion Models Learn Hidden Inter-Feature Rules Behind Images?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T21:50:24.564484Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2502.04725"},"observation_digest":"sha256:e3016f2eafb11725804b9ad47ecf701b7d3c5e1764060527fae39a241556ff1a","observation_id":"c49e43af-37aa-428c-ac7b-13d5de68f966","resolution":{"observed_at":"2026-08-08T21:50:24.564484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-07T21:17:55.970546Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09509","last_updated":"2025-08-04T10:44:54Z","snapshot_observed_at":"2026-08-09T00:33:22.873294Z","submitted_at":"2025-02-13T17:21:51Z","title":"EQ-VAE: Equivariance Regularized Latent Space for Improved Generative Image Modeling","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T21:17:55.970546Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2502.09509"},"observation_digest":"sha256:05d6c1c6408691b647943e4711d5965e6089189f59f92d549c0260b69118994c","observation_id":"10cd0c43-0c97-4a1f-becb-e3155bef9c2f","resolution":{"observed_at":"2026-08-07T21:17:55.970546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T16:24:27.407376Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2503.07265"},"observation_digest":"sha256:2bbc4254933e1d9b974d547f03a56d804c96d29c767ce761ca2bf6a8293d83dd","observation_id":"e1c44baf-a60b-4c92-a621-f698ecaee904","resolution":{"observed_at":"2026-05-15T16:24:27.751864Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-07T15:38:00.814329Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14436","last_updated":"2025-05-20T14:42:03Z","snapshot_observed_at":"2026-08-08T17:55:32.735439Z","submitted_at":"2025-05-20T14:42:03Z","title":"Neural Incompatibility: The Unbridgeable Gap of Cross-Scale Parametric Knowledge Transfer in Large Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:00.814329Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2505.14436"},"observation_digest":"sha256:785773724bc006449a28bade30c9a511c8aef96723e54343a7b25dfced14c917","observation_id":"2eeffe8e-f41a-455f-b1ba-1d03cabd9e9e","resolution":{"observed_at":"2026-08-07T15:38:00.814329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-07T15:24:59.516626Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15282","last_updated":"2025-05-21T09:02:53Z","snapshot_observed_at":"2026-08-07T22:12:37.154313Z","submitted_at":"2025-05-21T09:02:53Z","title":"Exploring In-Image Machine Translation with Real-World Background","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:24:59.516626Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2505.15282"},"observation_digest":"sha256:e9511bce842c0153fa7f8b3a512ed7c8b649fcc777a9badfb0ce933fe95d1101","observation_id":"956fea12-608a-4243-b21f-f75bd6803d44","resolution":{"observed_at":"2026-08-07T15:24:59.516626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-07T14:40:15.406732Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21530","last_updated":"2025-05-23T15:27:17Z","snapshot_observed_at":"2026-08-09T15:43:59.823505Z","submitted_at":"2025-05-23T15:27:17Z","title":"High-Fidelity Functional Ultrasound Reconstruction via A Visual Auto-Regressive Framework","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:15.406732Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2505.21530"},"observation_digest":"sha256:62e5114349d18d81c73756bbed768f2f8d0996c7c2d8b435a43ff2857333e89c","observation_id":"621f9e15-149f-43fc-85ae-e47a8008e143","resolution":{"observed_at":"2026-08-07T14:40:15.406732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-07T13:04:54.491666Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22792","last_updated":"2025-08-09T10:28:46Z","snapshot_observed_at":"2026-08-07T20:36:10.420718Z","submitted_at":"2025-05-28T19:03:37Z","title":"Rhetorical Text-to-Image Generation via Two-layer Diffusion Policy Optimization","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:04:54.491666Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2505.22792"},"observation_digest":"sha256:ccf1e06d5f42bbb5e847aebe485e2a9b3ab17d2ad453f3ab90f07e9bd3e184e6","observation_id":"4119b002-0687-4db5-aa0d-2233cc93f933","resolution":{"observed_at":"2026-08-07T13:04:54.491666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-07T11:58:40.740546Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:40.740546Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:673a71a6678ee487c13ef8a4dca918e0f915249e9a65ee1c42825f76a110b3ab","observation_id":"9b29c5b4-6da7-4c8d-952b-b502da87403a","resolution":{"observed_at":"2026-08-07T11:58:40.740546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-07T10:47:52.414118Z","title":"Visual autoregressive modeling: Scalable image gener- ation via next-scale prediction.arXiv preprint arXiv:2404.02905,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-10T04:27:59.621432Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.414118Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:0eeee1eebc3f4bb7aa2d53a53379559b4b50125fc19a8215cecc08afa6694aa6","observation_id":"463b4c9c-7be6-42e4-92f7-8ba3c45b4d01","resolution":{"observed_at":"2026-08-07T10:47:52.414118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-07T06:02:59.700606Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06276","last_updated":"2025-06-06T17:58:39Z","snapshot_observed_at":"2026-08-10T08:49:58.331655Z","submitted_at":"2025-06-06T17:58:39Z","title":"STARFlow: Scaling Latent Normalizing Flows for High-resolution Image Synthesis","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:59.700606Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2506.06276"},"observation_digest":"sha256:e2b01f0121aa0375077650044c558fd7e888162e2c9d474d5c2640ca26ca5c37","observation_id":"944abb33-b42e-401b-a854-8334322d4ede","resolution":{"observed_at":"2026-08-07T06:02:59.700606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-07T05:26:02.325132Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.325132Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:e837ad1a03e82ce68889a3531decbc333af9f9cf13786cfdd91874f289f69327","observation_id":"5a82c5ce-1d22-45c3-b8f0-cae910510371","resolution":{"observed_at":"2026-08-07T05:26:02.325132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-07T13:20:16.675513Z","title":"arXiv preprint arXiv:2404.02905 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15696","last_updated":"2025-05-28T07:11:49Z","snapshot_observed_at":"2026-08-07T18:02:16.197292Z","submitted_at":"2025-05-28T07:11:49Z","title":"CoC: Chain-of-Cancer based on Cross-Modal Autoregressive Traction for Survival Prediction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:16.675513Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2506.15696"},"observation_digest":"sha256:8547e4bd4fe4f69dd8e4a99273a8e8aed6da3d5ab836c604b6f1ddbe63e3ffd8","observation_id":"e121062a-77be-46cc-af57-d8d0aa5b3f50","resolution":{"observed_at":"2026-08-07T13:20:16.675513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T23:28:07.776955Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-06T23:20:59.622434Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:07.776955Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:45c5dfce402a7b060d59557b89caa8b2f9e81730102510823d3f03b9c23f65d3","observation_id":"6c6b19f1-d144-4ac2-baae-41fc252e9ec4","resolution":{"observed_at":"2026-08-06T23:28:07.776955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T22:43:04.234499Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21022","last_updated":"2025-06-26T05:48:36Z","snapshot_observed_at":"2026-08-07T15:30:22.761798Z","submitted_at":"2025-06-26T05:48:36Z","title":"Instella-T2I: Pushing the Limits of 1D Discrete Latent Space Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:43:04.234499Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2506.21022"},"observation_digest":"sha256:7108ec335cca548529899e80a2e3d6a30d541bb35e97f7e9861ebf4aa7d8f168","observation_id":"7e1f0a75-9876-4c36-8caa-c1527bff8700","resolution":{"observed_at":"2026-08-06T22:43:04.234499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T21:49:44.581169Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23347","last_updated":"2025-07-07T16:20:58Z","snapshot_observed_at":"2026-08-08T19:09:33.549872Z","submitted_at":"2025-06-29T17:43:04Z","title":"CycleVAR: Repurposing Autoregressive Model for Unsupervised One-Step Image Translation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.581169Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2506.23347"},"observation_digest":"sha256:29473d6c459accd4bbcc52b116ca8a82656d22c2bc78c5521818a6b741991b93","observation_id":"9dc51c88-7357-4f98-a4a9-1de3b1eb3ffd","resolution":{"observed_at":"2026-08-06T21:49:44.581169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T21:46:29.478571Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23589","last_updated":"2025-06-30T07:51:58Z","snapshot_observed_at":"2026-08-08T08:02:50.830843Z","submitted_at":"2025-06-30T07:51:58Z","title":"Transition Matching: Scalable and Flexible Generative Modeling","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T21:46:29.478571Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2506.23589"},"observation_digest":"sha256:7c5c6157a5c33ef92cf2f5c66e95e8efa4b2b252c760494d313ec3927fcec8ce","observation_id":"e6940ed3-9957-47f0-88c4-acdfa6af7c69","resolution":{"observed_at":"2026-08-06T21:46:29.478571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T21:19:45.091175Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-07T23:46:04.736988Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.091175Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:a8da23c4ab16ae1598dd6f53b228d1583020c5cb313563660ad4ebc69d4cf2c5","observation_id":"72462e34-fbb2-48d0-9d92-2f6d9989153a","resolution":{"observed_at":"2026-08-06T21:19:45.091175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T20:53:50.735276Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction.arXiv preprint arXiv:2404.02905, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01652","last_updated":"2025-07-02T12:27:06Z","snapshot_observed_at":"2026-08-09T07:28:28.701691Z","submitted_at":"2025-07-02T12:27:06Z","title":"Autoregressive Image Generation with Linear Complexity: A Spatial-Aware Decay Perspective","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:50.735276Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2507.01652"},"observation_digest":"sha256:6ed026b35a6d4462f594c9aae4ebca3c03e67ecf2059c40d900a3d05533686ea","observation_id":"5cdea1a8-c53a-44ee-8b72-d77010d5c024","resolution":{"observed_at":"2026-08-06T20:53:50.735276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T20:38:57.032639Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:57.032639Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:aa1070d987008aad6f7bfc29b2a00a5a7d22b51035cea9fd0c9b28150dd9fe16","observation_id":"0545d7ab-e8ab-4af0-aa92-0f0e0a056a55","resolution":{"observed_at":"2026-08-06T20:38:57.032639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T20:32:59.851177Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-09T23:50:06.162470Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.851177Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:9dde2d9ab8dd730959e3c25bba3b1b591f6ff31f6555501ab326d773cfe55e94","observation_id":"c331c4ef-5f0d-4885-8015-dc306921171d","resolution":{"observed_at":"2026-08-06T20:32:59.851177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T20:39:13.582808Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03038","last_updated":"2025-07-23T08:06:29Z","snapshot_observed_at":"2026-08-08T11:13:39.270041Z","submitted_at":"2025-07-03T05:49:18Z","title":"Cautious Next Token Prediction","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:39:13.582808Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2507.03038"},"observation_digest":"sha256:847d9c21e8f7ba2f08c6df2538b7fbd32d676ea5ac58e0f2de2c12e0f2154834","observation_id":"a7b8f6bf-c5f6-41d4-af45-62a8b04c1406","resolution":{"observed_at":"2026-08-06T20:39:13.582808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T19:52:28.093409Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04559","last_updated":"2025-07-06T22:23:27Z","snapshot_observed_at":"2026-08-11T01:01:49.187571Z","submitted_at":"2025-07-06T22:23:27Z","title":"MambaVideo for Discrete Video Tokenization with Channel-Split Quantization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:52:28.093409Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2507.04559"},"observation_digest":"sha256:f70e84d13e7b49be9be0b7c61d2c78a57968dfd0a1c7bad4c6bd426c3a81f3b2","observation_id":"6922dc7f-bc2e-4614-b45c-672fe72dca08","resolution":{"observed_at":"2026-08-06T19:52:28.093409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T17:12:34.614860Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11441","last_updated":"2025-07-28T14:28:07Z","snapshot_observed_at":"2026-08-09T20:06:34.981505Z","submitted_at":"2025-07-15T16:05:30Z","title":"Implementing Adaptations for Vision AutoRegressive Model","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T17:12:34.614860Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2507.11441"},"observation_digest":"sha256:de46201d5ea17f761c28a0ac1eb8e674fd9807e89b8be7b76166aa4ec72dbe44","observation_id":"b085723f-8da0-459c-b4b6-83be057144a1","resolution":{"observed_at":"2026-08-06T17:12:34.614860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T11:38:36.823952Z","title":"arXiv preprint arXiv:2404.02905 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22530","last_updated":"2025-07-31T03:01:47Z","snapshot_observed_at":"2026-08-10T17:28:20.440361Z","submitted_at":"2025-07-30T09:57:38Z","title":"HRVVS: A High-resolution Video Vasculature Segmentation Network via Hierarchical Autoregressive Residual Priors","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:38:36.823952Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2507.22530"},"observation_digest":"sha256:7f4a40922a81e61b8a18f60ed064d14c151d98ef24e00c20781a8a702cadd1a6","observation_id":"7e04678f-8b4e-4b4a-af7b-5d204de7e867","resolution":{"observed_at":"2026-08-06T11:38:36.823952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T05:31:33.619804Z","title":"Visual autoregres- sive modeling: Scalable image generation via next-scale prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01782","last_updated":"2026-07-24T01:22:37Z","snapshot_observed_at":"2026-08-08T12:46:21.888159Z","submitted_at":"2025-08-03T14:45:51Z","title":"Joint Lossless Compression and Steganography for Medical Images via Large Language Models","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T05:31:33.619804Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2508.01782"},"observation_digest":"sha256:19ef15bdbac01e3ed1d06c55734f7126f74061e6bae722a70a616ea92ddb26e7","observation_id":"e041e701-8573-4ea0-8ccf-a6072d7f67d8","resolution":{"observed_at":"2026-08-06T05:31:33.619804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T05:19:29.750778Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02056","last_updated":"2025-08-09T02:25:59Z","snapshot_observed_at":"2026-08-10T11:27:20.332081Z","submitted_at":"2025-08-04T04:50:05Z","title":"StarPose: 3D Human Pose Estimation via Spatial-Temporal Autoregressive Diffusion","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T05:19:29.750778Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2508.02056"},"observation_digest":"sha256:6d93290bb52af56ad0cc5305348025945b2e9de854de1b229233ec49082adc81","observation_id":"6adb60b0-7778-4b42-bb90-895e2d417c12","resolution":{"observed_at":"2026-08-06T05:19:29.750778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T20:25:12.063091Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10615","last_updated":"2025-08-14T13:12:29Z","snapshot_observed_at":"2026-08-06T19:53:35.593518Z","submitted_at":"2025-08-14T13:12:29Z","title":"FuXi-\\beta: Towards a Lightweight and Fast Large-Scale Generative Recommendation Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T20:25:12.063091Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2508.10615"},"observation_digest":"sha256:c37fae8c95f9f63912ac1b91c7159920134015a2ebdb3c51c7296c054169266b","observation_id":"b364c00e-154f-4734-abc1-0f1e1dc0afa7","resolution":{"observed_at":"2026-08-05T20:25:12.063091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T12:07:36.753406Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01984","last_updated":"2025-09-03T05:25:38Z","snapshot_observed_at":"2026-08-09T17:45:06.450924Z","submitted_at":"2025-09-02T06:01:52Z","title":"Discrete Noise Inversion for Next-scale Autoregressive Text-based Image Editing","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T12:07:36.753406Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2509.01984"},"observation_digest":"sha256:74f7fab8f95bf7ea1d3f02ddc5a077a00c0010f30b6e827880df2ddab11592a2","observation_id":"03ea97dd-cb5b-469d-87a8-c4b36faeda82","resolution":{"observed_at":"2026-08-05T12:07:36.753406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-04T18:12:47.607231Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10140","last_updated":"2025-09-12T11:08:21Z","snapshot_observed_at":"2026-08-10T20:39:08.643314Z","submitted_at":"2025-09-12T11:08:21Z","title":"Scalable Training for Vector-Quantized Networks with 100% Codebook Utilization","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T18:12:47.607231Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2509.10140"},"observation_digest":"sha256:b42a46e2b4529f87bb4ce10dccbc9d7ea9c4e8a591259fef8ef2cce34a27f441","observation_id":"e72b48e1-f76a-42fb-86b3-dcad5db7bf7e","resolution":{"observed_at":"2026-08-04T18:12:47.607231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-04T07:22:17.259251Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.27497","last_updated":"2026-07-18T14:25:55Z","snapshot_observed_at":"2026-08-09T16:43:09.938261Z","submitted_at":"2025-10-31T14:19:50Z","title":"InertialAR: Autoregressive 3D Molecule Generation with Inertial Frames","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:17.259251Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2510.27497"},"observation_digest":"sha256:45a0f71783aed780b0a964b2dd8518c8acb8e80de286736dee7eab0e573d9252","observation_id":"3f8d344b-98b5-4ca1-9b5b-65080d7c805d","resolution":{"observed_at":"2026-08-04T07:22:17.259251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-03T15:34:59.272712Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction.arXiv preprint arXiv:2404.02905, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.16636","last_updated":"2026-07-18T11:24:13Z","snapshot_observed_at":"2026-08-07T17:53:52.987639Z","submitted_at":"2025-12-18T15:10:42Z","title":"REGLUE Your Latents with Global and Local Semantics for Entangled Diffusion","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T15:34:59.272712Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2512.16636"},"observation_digest":"sha256:4f42a06d4d3ebc32fffbe560014f24c56158911f34da02eecff882b3897a1f0a","observation_id":"d9c1e3ad-5dd4-4956-8844-f9f8c7b7c7f7","resolution":{"observed_at":"2026-08-03T15:34:59.272712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2601.21798","last_updated":"2026-05-15T11:47:00Z","snapshot_observed_at":"2026-08-02T04:56:07.337606Z","submitted_at":"2026-01-29T14:42:46Z","title":"CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T14:48:21.787919Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2601.21798"},"observation_digest":"sha256:8f9afd99b92b41eca9fa324b3edd9f6378f0fd1b8b9d3b5c8c871a688ed8b30e","observation_id":"2c51f95a-e5c3-48c6-850b-70aafb6c13f4","resolution":{"observed_at":"2026-05-21T14:50:14.905925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-03T03:25:00.856914Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction.arXiv preprint arXiv:2404.02905, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08337","last_updated":"2026-07-02T05:59:45Z","snapshot_observed_at":"2026-08-10T05:27:02.440159Z","submitted_at":"2026-02-09T07:22:14Z","title":"Language-Guided Transformer Tokenizer for Human Motion Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T03:25:00.856914Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2602.08337"},"observation_digest":"sha256:2e270a7a91bc0df837d20db2df0a50b826774e7e9220eb123193d10bebc223f2","observation_id":"fa7ffe04-5f60-43c7-8e39-b2322a2433d5","resolution":{"observed_at":"2026-08-03T03:25:00.856914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-07-15T13:50:51.666642Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06453","last_updated":"2026-06-01T03:19:19Z","snapshot_observed_at":"2026-08-09T12:55:54.034760Z","submitted_at":"2026-03-06T16:43:44Z","title":"Pinterest Canvas: Large-Scale Image Generation at Pinterest","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-15T13:50:51.666642Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2603.06453"},"observation_digest":"sha256:0e022dcea3ff9da9fa75f9afe2f962651563c86d4ac23642706ea2690901257b","observation_id":"8599a202-8d46-4591-8938-d4fbc97564a3","resolution":{"observed_at":"2026-07-15T13:50:51.666642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2604.13030","last_updated":"2026-07-07T13:17:16Z","snapshot_observed_at":"2026-07-12T21:00:28.771955Z","submitted_at":"2026-04-14T17:59:03Z","title":"Generative Refinement Networks for Visual Synthesis","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T15:41:23.057949Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2604.13030"},"observation_digest":"sha256:c2d0cb77428a0740a7c8470faf82414a96431f426e3de10f22039320e1b47e27","observation_id":"deddcb0a-0fe0-49c6-8f6f-fab0a95d9d8c","resolution":{"observed_at":"2026-05-11T10:01:03.170979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-07-12T21:00:35.123495Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.13030","last_updated":"2026-07-07T13:17:16Z","snapshot_observed_at":"2026-07-12T21:00:28.771955Z","submitted_at":"2026-04-14T17:59:03Z","title":"Generative Refinement Networks for Visual Synthesis","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T21:00:35.123495Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2604.13030"},"observation_digest":"sha256:18b8d983eafa29226fd790f4a455b6487bf99d600dca38fd9253bee30f70861d","observation_id":"46f1a57f-98b3-4157-bcd9-012fd358eb4f","resolution":{"observed_at":"2026-07-12T21:00:35.123495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2604.19330","last_updated":"2026-04-29T12:12:36Z","snapshot_observed_at":"2026-08-03T01:33:20.785741Z","submitted_at":"2026-04-21T10:58:48Z","title":"Text-To-Speech with Chain-of-Details: modeling temporal dynamics in speech generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T01:01:06.094276Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2604.19330"},"observation_digest":"sha256:190129108afecbd2947ce523e1fd19cd2183e17796eac655e2ac659fd5428edf","observation_id":"0469d808-47ad-4bbe-ae39-dfda3f3e0aeb","resolution":{"observed_at":"2026-05-10T01:04:50.133561Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2604.19902","last_updated":"2026-04-21T18:25:25Z","snapshot_observed_at":"2026-08-02T14:48:34.514966Z","submitted_at":"2026-04-21T18:25:25Z","title":"MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T03:27:50.144706Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2604.19902"},"observation_digest":"sha256:ff50a28a23b0fa532430fe3e7caec0a49ab9079597a7af9fd76c285a2e737184","observation_id":"af125df3-6c61-462c-946a-bf973da75c54","resolution":{"observed_at":"2026-05-10T03:29:21.706947Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2605.08078","last_updated":"2026-05-12T22:42:27Z","snapshot_observed_at":"2026-07-06T23:20:19.821342Z","submitted_at":"2026-05-08T17:57:14Z","title":"Normalizing Trajectory Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T01:55:30.852030Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.08078"},"observation_digest":"sha256:4b5ee7758759e1b64b510641a7f60a145c632d60d409ad517126b4abac83463c","observation_id":"4dd55285-e8f5-4959-be4a-0c54419c273a","resolution":{"observed_at":"2026-05-11T04:10:55.014588Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2605.08078","last_updated":"2026-05-12T22:42:27Z","snapshot_observed_at":"2026-07-06T23:20:19.821342Z","submitted_at":"2026-05-08T17:57:14Z","title":"Normalizing Trajectory Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T21:16:53.641457Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.08078"},"observation_digest":"sha256:8097d9898e253ced8bc9325d3cb6a63b1d60a2438eb6dcd97f3bdd9d39621997","observation_id":"085bce16-a77c-4529-92ba-498749d3a624","resolution":{"observed_at":"2026-05-14T21:17:58.733808Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2605.11380","last_updated":"2026-05-12T01:13:16Z","snapshot_observed_at":"2026-08-03T03:48:21.836941Z","submitted_at":"2026-05-12T01:13:16Z","title":"TRACE: Temporal Routing with Autoregressive Cross-channel Experts for EEG Representation Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-13T02:22:59.247850Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.11380"},"observation_digest":"sha256:a87fb60d1ac1fdfdbe6b0effae42f5e61645fa72e5cc4bea42320ce5ce755b24","observation_id":"5b4b231a-8f83-4a8d-84d3-6bbda913b35f","resolution":{"observed_at":"2026-05-13T02:27:07.499894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2605.16384","last_updated":"2026-05-11T10:51:02Z","snapshot_observed_at":"2026-07-06T23:27:34.514541Z","submitted_at":"2026-05-11T10:51:02Z","title":"Mutual Enhancement Between Global Tokens and Patch Tokens: From Theory to Practice","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-20T22:41:44.510546Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.16384"},"observation_digest":"sha256:5dce1a0a5bdedbcfc5b873b7c19c5a6ce1c35f3e0723a1d769a5eb9cbf8b293b","observation_id":"74e2ea72-7abf-4b0b-9e0f-873877f3d55a","resolution":{"observed_at":"2026-05-20T22:43:51.045051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2605.18267","last_updated":"2026-07-24T06:29:36Z","snapshot_observed_at":"2026-08-02T13:49:17.490757Z","submitted_at":"2026-05-18T12:03:41Z","title":"SRC-Flow: Compact Semantic Representations Enable Normalizing Flows for Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T11:59:54.139888Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.18267"},"observation_digest":"sha256:211a7ef86c42c9b91f268b4d903f49a792890f50866074a0db9f8b28844a5310","observation_id":"6e2dedba-bbfb-49dd-8411-78c31672b540","resolution":{"observed_at":"2026-05-20T12:03:15.386946Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2605.18267","last_updated":"2026-07-24T06:29:36Z","snapshot_observed_at":"2026-08-02T13:49:17.490757Z","submitted_at":"2026-05-18T12:03:41Z","title":"SRC-Flow: Compact Semantic Representations Enable Normalizing Flows for Image Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T18:39:40.667006Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.18267"},"observation_digest":"sha256:89106ffcec77f6b5c92a04d3321fcc23e9a4839e970a283409229e6fda655b10","observation_id":"24f58dbd-1847-4812-a2d1-7477efe571c5","resolution":{"observed_at":"2026-06-30T18:55:00.880061Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-02T13:49:19.647602Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.18267","last_updated":"2026-07-24T06:29:36Z","snapshot_observed_at":"2026-08-02T13:49:17.490757Z","submitted_at":"2026-05-18T12:03:41Z","title":"SRC-Flow: Compact Semantic Representations Enable Normalizing Flows for Image Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T13:49:19.647602Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.18267"},"observation_digest":"sha256:3cf45c9a35b35bd89ee5bdab7c5ed3854313f58b696f0e6e817c18db07ebf3b0","observation_id":"c0e8b435-e4df-4f72-a77b-518e4cab39ef","resolution":{"observed_at":"2026-08-02T13:49:19.647602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-07-06T23:29:14.916114Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:30766707782ed67f5140e22d7188fdb88dc9d417964b23017bdc9d09ec056898","observation_id":"6a3834f3-bfc7-4c5b-bde3-a61da64e68a9","resolution":{"observed_at":"2026-05-20T11:03:13.431357Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2605.27696","last_updated":"2026-05-28T13:12:21Z","snapshot_observed_at":"2026-07-06T23:37:21.716437Z","submitted_at":"2026-05-26T21:16:04Z","title":"Structure over Pixels: Learning Variable-Length Visual Programs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T18:06:01.684713Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.27696"},"observation_digest":"sha256:7127b092426c231251f2502e9b4d0438aacb154b477c876bc5918ce04e2bdcb2","observation_id":"dd5b4dfa-05d3-4d4a-b4e3-ea7130a7e7f3","resolution":{"observed_at":"2026-06-29T18:13:48.992424Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2605.30341","last_updated":"2026-05-28T17:59:26Z","snapshot_observed_at":"2026-07-06T23:39:38.845840Z","submitted_at":"2026-05-28T17:59:26Z","title":"GPIC: A Giant Permissive Image Corpus for Visual Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T07:36:21.262064Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.30341"},"observation_digest":"sha256:f403dd62bf5c732a27f31e93677abd12fb9316c791cfb5cb7378a9183a7504bd","observation_id":"5f206bdb-b56a-4463-90cf-951d1da76bde","resolution":{"observed_at":"2026-06-29T07:43:14.161443Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:2c2bea5935214eaf2ee15ade11eafe0aa2612a35693258c60ddf8c8a3f7fb00a","observation_id":"7a9eac4a-74fb-4c34-8054-3bb219dba706","resolution":{"observed_at":"2026-07-02T17:37:14.616849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2606.09156","last_updated":"2026-06-08T07:47:53Z","snapshot_observed_at":"2026-08-02T15:02:48.666653Z","submitted_at":"2026-06-08T07:47:53Z","title":"OmniGen-AR: AutoRegressive Any-to-Image Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-27T17:05:16.883488Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2606.09156"},"observation_digest":"sha256:10380051eb3d74e8e0900180dc6699bf33d86b1250dbb3eec6f204136f329a66","observation_id":"ea1f55ad-4600-458d-be96-a18ba8af89bf","resolution":{"observed_at":"2026-07-03T00:47:29.665114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2606.27088","last_updated":"2026-07-19T08:07:12Z","snapshot_observed_at":"2026-08-07T23:00:15.253945Z","submitted_at":"2026-06-25T14:24:03Z","title":"SubdivAR: Autoregressive Next-Scale Prediction for Neural Mesh Subdivision","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T05:01:44.347859Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2606.27088"},"observation_digest":"sha256:13eaa58fe3dcd916e39669fc2517f94b01a70620d9daf4e5c9e644d6ba1152ed","observation_id":"9c7ac308-bf41-4d0b-8395-357a56231a49","resolution":{"observed_at":"2026-07-04T13:39:51.006842Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-02T10:07:06.115453Z","title":"Visual autoregressive mod- eling: Scalable image generation via next-scale prediction.arXiv preprint arXiv:2404.02905, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27088","last_updated":"2026-07-19T08:07:12Z","snapshot_observed_at":"2026-08-07T23:00:15.253945Z","submitted_at":"2026-06-25T14:24:03Z","title":"SubdivAR: Autoregressive Next-Scale Prediction for Neural Mesh Subdivision","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T10:07:06.115453Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2606.27088"},"observation_digest":"sha256:9aa4bb24ff30738b9f149e85feac969f2a4e57181922ea9e06b1ce4ca6837325","observation_id":"1c819c78-e0aa-405f-9ed6-28be8e9a3637","resolution":{"observed_at":"2026-08-02T10:07:06.115453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2606.31991","last_updated":"2026-06-30T17:29:04Z","snapshot_observed_at":"2026-07-07T00:05:37.068846Z","submitted_at":"2026-06-30T17:29:04Z","title":"Amplifying Membership Signal Through Chained Regeneration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-01T06:22:08.140403Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2606.31991"},"observation_digest":"sha256:3cca539dd2da3089f423ba58fcd077654ae5730246847b52974c849986d2ebb6","observation_id":"ba787460-7882-4003-a7cb-b410f43850c5","resolution":{"observed_at":"2026-07-01T09:45:39.297920Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-07-12T01:50:59.184754Z","title":"arXiv preprint arXiv:2404.02905 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03530","last_updated":"2026-07-03T17:59:58Z","snapshot_observed_at":"2026-08-04T18:44:44.436706Z","submitted_at":"2026-07-03T17:59:58Z","title":"MentalThink: Shaping Thoughts in Mental SVG World","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-12T01:50:59.184754Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2607.03530"},"observation_digest":"sha256:ab88832d951a162901b74512d0f9846512c8f5093027306d3751b9ef4b154c00","observation_id":"98f86f12-26fd-4466-b869-57bf08f09e9b","resolution":{"observed_at":"2026-07-12T01:50:59.184754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.02905/citation-record","integrity":"/paper/2404.02905/integrity","json":"/paper/2404.02905/citation-record.json","paper":"/paper/2404.02905"},"outbound":[],"paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 78 inbound Pith citation observations for arXiv:2404.02905."}