{"as_of":"2026-08-18T22:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b359ed39ae115e0ceacaf767b683262b434b3716ea4f1781500947752e88131","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:16:47.640589Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:38:30.597797Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:33:15.180082Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"cited_work":{"arxiv_id":"2501.12389","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12389","snapshot_observed_at":"2026-06-29T08:33:15.180082Z","title":"Ni, and Heung-Yeung Shum","venue":null,"work_id":"e1a95892-4377-4549-938b-cfb4947576e9","year":2025},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2501.12389","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:6805d6d2a8c27819ec6ce602ea75e17eb6f25bcc5e9d26ee8c48b53acdaefe9c","observation_id":"345c7c81-7ca0-4f60-9dcd-030355ebec85","resolution":{"observed_at":"2026-05-19T08:02:23.524350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"cited_work":{"arxiv_id":"2501.12389","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12389","snapshot_observed_at":"2026-06-29T08:33:15.180082Z","title":"Ni, and Heung-Yeung Shum","venue":null,"work_id":"e1a95892-4377-4549-938b-cfb4947576e9","year":2025},"citing_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-08-15T15:00:19.916941Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T23:05:17.201790Z"},"links":{"cited_paper":"/paper/2501.12389","citing_paper":"/paper/2503.19325"},"observation_digest":"sha256:c3e66277c00cffcc63e0d43014f0f24a766e0513e8993941944524fef514f57a","observation_id":"55028210-12d4-41f0-a85b-e1e6bffa0950","resolution":{"observed_at":"2026-05-16T23:05:17.429070Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"cited_work":{"arxiv_id":"2501.12389","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12389","snapshot_observed_at":"2026-06-29T08:33:15.180082Z","title":"Ni, and Heung-Yeung Shum","venue":null,"work_id":"e1a95892-4377-4549-938b-cfb4947576e9","year":2025},"citing_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-12T22:02:52.918587Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-17T07:24:04.460276Z"},"links":{"cited_paper":"/paper/2501.12389","citing_paper":"/paper/2505.05472"},"observation_digest":"sha256:d07a8ceb1d00c81d13a8686a5bc7ab67e12b893d75b8ad7fac1805021d5670e5","observation_id":"3c4f6c91-da64-4f9a-bd15-5b1934e03dc2","resolution":{"observed_at":"2026-05-17T07:24:04.751003Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12389","snapshot_observed_at":"2026-08-15T20:38:30.597797Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12489","last_updated":"2025-05-21T04:44:19Z","snapshot_observed_at":"2026-08-17T20:11:15.369850Z","submitted_at":"2025-05-18T16:22:58Z","title":"Video-GPT via Next Clip Diffusion","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:30.597797Z"},"links":{"cited_paper":"/paper/2501.12389","citing_paper":"/paper/2505.12489"},"observation_digest":"sha256:dac3068640ebf4dd39b85222f9789421d2ef0be94b58e06fc4db0a4b485af733","observation_id":"cd409e12-1029-48c4-809c-a2fcf0b85d56","resolution":{"observed_at":"2026-08-15T20:38:30.597797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12389","snapshot_observed_at":"2026-08-07T00:30:29.656888Z","title":"Taming teacher forcing for masked autoregressive video generation.arXiv preprint arXiv:2501.12389, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14168","last_updated":"2025-06-18T09:44:09Z","snapshot_observed_at":"2026-08-13T05:38:52.343886Z","submitted_at":"2025-06-17T04:08:18Z","title":"VideoMAR: Autoregressive Video Generatio with Continuous Tokens","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:29.656888Z"},"links":{"cited_paper":"/paper/2501.12389","citing_paper":"/paper/2506.14168"},"observation_digest":"sha256:63affe52ef1038b25d4ecc6186bba6af0b028b72633459ba1f9135cd1810554a","observation_id":"b302fce3-bb57-4116-9db3-a28e75632476","resolution":{"observed_at":"2026-08-07T00:30:29.656888Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"cited_work":{"arxiv_id":"2501.12389","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12389","snapshot_observed_at":"2026-06-29T08:33:15.180082Z","title":"Ni, and Heung-Yeung Shum","venue":null,"work_id":"e1a95892-4377-4549-938b-cfb4947576e9","year":2025},"citing_paper":{"arxiv_id":"2509.22622","last_updated":"2025-10-13T22:41:26Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T17:48:24Z","title":"LongLive: Real-time Interactive Long Video Generation","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-15T03:52:59.287555Z"},"links":{"cited_paper":"/paper/2501.12389","citing_paper":"/paper/2509.22622"},"observation_digest":"sha256:8b9d4bdbb2c774ffffa8785148f730858a0672b19985dee023e0c06a625de31c","observation_id":"6fa80ef5-e219-4eeb-9890-eb40db8a9af9","resolution":{"observed_at":"2026-05-15T03:52:59.443581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"cited_work":{"arxiv_id":"2501.12389","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12389","snapshot_observed_at":"2026-06-29T08:33:15.180082Z","title":"Ni, and Heung-Yeung Shum","venue":null,"work_id":"e1a95892-4377-4549-938b-cfb4947576e9","year":2025},"citing_paper":{"arxiv_id":"2605.30083","last_updated":"2026-05-28T15:30:04Z","snapshot_observed_at":"2026-08-08T04:25:10.823052Z","submitted_at":"2026-05-28T15:30:04Z","title":"Future Forcing: Future-aware Training-free KV Cache Policy for Autoregressive Video Generation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-29T08:30:00.438334Z"},"links":{"cited_paper":"/paper/2501.12389","citing_paper":"/paper/2605.30083"},"observation_digest":"sha256:74b8e6c103dc0f7995addc3a06e987560a09659214957ba63c0e4147be44b327","observation_id":"802ff53e-027c-462f-90df-0204cb5e436c","resolution":{"observed_at":"2026-06-29T08:33:15.181604Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12389","snapshot_observed_at":"2026-08-08T04:54:58.686040Z","title":"Ni, and Heung-Yeung Shum","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05648","last_updated":"2026-08-06T06:46:35Z","snapshot_observed_at":"2026-08-16T01:12:23.794339Z","submitted_at":"2026-08-06T06:46:35Z","title":"Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:58.686040Z"},"links":{"cited_paper":"/paper/2501.12389","citing_paper":"/paper/2608.05648"},"observation_digest":"sha256:f4df802facd4941a2600d550c5bc922b81f5cadee19833c1f0a9df6abba9ea44","observation_id":"ea3bcdc1-ed91-4ee5-aa03-278c26125255","resolution":{"observed_at":"2026-08-08T04:54:58.686040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12389/citation-record","integrity":"/paper/2501.12389/integrity","json":"/paper/2501.12389/citation-record.json","paper":"/paper/2501.12389"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.399672Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.399672Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:40602f06b5081ac56e4a262c1acc3a4ae95a6f7b7dc11bb93a3315a75de96448","observation_id":"c8217c3c-1ec2-4900-92fd-e6926197cce8","resolution":{"observed_at":"2026-08-10T17:16:47.399672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.215786Z","title":"Ge- nie: Generative interactive environments","venue":null,"work_id":"09c28cfc-b8ac-4405-aa41-d96d6b513216","year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.404985Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:088ce1eb288226f017a1e479e9d4b2e7951ffbfc4d11719e892a1da1dcef530a","observation_id":"ffde491b-2e00-4ec5-8920-a7b15e856a4b","resolution":{"observed_at":"2026-08-10T17:16:48.220054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.410911Z","title":"A short note about kinetics-","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.410911Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:def2afd51a84243f2021956fe1116fac955bda7e71e6ed2678c08d3652941c2a","observation_id":"a0ad7479-a4f6-4d31-92cd-85adb495846b","resolution":{"observed_at":"2026-08-10T17:16:47.410911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.197806Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":"afc34b66-faa8-4cc7-8a75-7e00301d89b8","year":2022},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.423531Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:9716f2ba24d9ee102cf8548d02170d1c5d8878013380741d0a4509aea0ce3a23","observation_id":"0f6a07e0-4a77-47f0-90b2-a47632a79e8b","resolution":{"observed_at":"2026-08-10T17:16:48.201480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-16T16:04:52.013149Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-10T17:16:47.428417Z","title":"Freeman, Michael Rubinstein, Yuanzhen Li, and Dilip Krishnan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.428417Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:6ac9b386a8f9b57a8a0febb0a475601ba831a6a8175290c19bff20f053827a51","observation_id":"732eac7f-53c7-4c1b-a645-30a724bc8542","resolution":{"observed_at":"2026-08-10T17:16:47.428417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01392","last_updated":"2024-12-10T01:32:23Z","snapshot_observed_at":"2026-08-16T13:38:04.174848Z","submitted_at":"2024-07-01T15:43:25Z","title":"Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01392","snapshot_observed_at":"2026-08-10T17:16:47.433670Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffu- sion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.433670Z"},"links":{"cited_paper":"/paper/2407.01392","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:1f272d5d0e7f658e3e60b74f3d8ffb79d88f678f6733caa515afececd1a5754e","observation_id":"c65c365c-b92e-45bf-b664-3df86884fa53","resolution":{"observed_at":"2026-08-10T17:16:47.433670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.438930Z","title":"Pixart-α: Fast training of dif- fusion transformer for photorealistic text-to-image synthesis,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.438930Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:c6fdd94e7c98971783842fe070cf0ac84abbc1551a7d27c8e47cff0299b45999","observation_id":"4938ebbd-83b1-41e1-94ed-0f664cc0ba32","resolution":{"observed_at":"2026-08-10T17:16:47.438930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13863","last_updated":"2024-10-17T17:59:59Z","snapshot_observed_at":"2026-08-18T20:25:20.454774Z","submitted_at":"2024-10-17T17:59:59Z","title":"Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13863","snapshot_observed_at":"2026-08-10T17:16:47.443669Z","title":"Fluid: Scaling autoregressive text-to-image generative models with continuous tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.443669Z"},"links":{"cited_paper":"/paper/2410.13863","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:6779779ca1afcb18846550c62ae05603f3c70245eeeefcc810eb5045836ddee3","observation_id":"cbcca705-c57c-42c6-801d-1a7716c2711d","resolution":{"observed_at":"2026-08-10T17:16:47.443669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.180207Z","title":"Model tells you what to discard: Adaptive KV cache compression for llms","venue":null,"work_id":"8dd4ddc8-b0c0-4029-8803-ca8ce640ac96","year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.448666Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:2945ba9d2058a218b8ec65bd27f41d28cbc0bdc0883f6961b3bf129a4217ec70","observation_id":"1445b4f2-170d-4b06-8734-2ab442a3606c","resolution":{"observed_at":"2026-08-10T17:16:48.183696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.169485Z","title":"Courville, and Yoshua Bengio","venue":null,"work_id":"7de4dc31-5b10-447f-a92a-ca7aa838a936","year":2016},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.453799Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:3104e28da479b8d722877eeee520cc24d013e4616081c7560072697d2890c870","observation_id":"3747f35a-5d14-43f0-91d7-ffaa29e449cc","resolution":{"observed_at":"2026-08-10T17:16:48.173588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-17T14:04:31.230742Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-10T17:16:47.459726Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.459726Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:0bfafd1c2116b67ccbdf2707fbb09135afc8e577c2cfff8a355289b55700be65","observation_id":"5c2b762b-3225-4277-8b34-04e9748f73ae","resolution":{"observed_at":"2026-08-10T17:16:47.459726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.157314Z","title":"Girshick","venue":null,"work_id":"5d1bc914-dae0-4a67-9366-41f64ca0ea40","year":2022},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.466231Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:d5148b89a194f445d874cff61b56ad2e7f02c7379ae98084685ec8b93da626df","observation_id":"7d6aa9f6-43dd-4825-9437-05471e6be217","resolution":{"observed_at":"2026-08-10T17:16:48.162173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-17T16:16:01.560363Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-10T17:16:47.471762Z","title":"Latent video diffusion models for high-fidelity video generation with arbitrary lengths","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.471762Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:d1e271726c684682674ad2514cd5bfee0b841907dd9f4c21aaf9074af22e378e","observation_id":"9f9aade9-01a3-42b4-b197-10715474df14","resolution":{"observed_at":"2026-08-10T17:16:47.471762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.146129Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"b0c7e6ea-e3ab-4df1-8333-cb5ba34347d3","year":2020},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.476470Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:53eedec3803351f8869c51e36074ab77ec6d0c40ec813b5f029fdf05aeddcb11","observation_id":"1fef39fe-5590-46f6-86dd-06d1877d2ddd","resolution":{"observed_at":"2026-08-10T17:16:48.150461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.134674Z","title":"Video dif- fusion models","venue":null,"work_id":"fed04266-05cf-4e40-802c-5bcc137467a4","year":2022},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.480978Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:a3e527f60ed451fd78add684250b0ca9b95fa808c4df8a5f68965406f66d3273","observation_id":"20159b2a-dec4-49b3-a901-7709bb2635ef","resolution":{"observed_at":"2026-08-10T17:16:48.138967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.11972","last_updated":"2023-06-14T03:32:57Z","snapshot_observed_at":"2026-08-16T16:06:32.038168Z","submitted_at":"2022-12-22T18:55:45Z","title":"Scalable Adaptive Computation for Iterative Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.11972","snapshot_observed_at":"2026-08-10T17:16:47.485858Z","title":"Scalable adap- tive computation for iterative generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.485858Z"},"links":{"cited_paper":"/paper/2212.11972","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:e1785798f594b86ef57e4874fbfccc4c1237e26e2f7134aa19f37571e513433e","observation_id":"b9eed922-6652-4e54-b265-d2e2379095d5","resolution":{"observed_at":"2026-08-10T17:16:47.485858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-08-14T12:12:01.418974Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-10T17:16:47.490673Z","title":"Videopoet: A large language model for zero-shot video gen- eration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.490673Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:f3c1272560d9a1a92e73dd967cd42ec664f6998fe89d0e962e2447446e753437","observation_id":"360b747a-18fe-4dfd-b74e-0848a829e321","resolution":{"observed_at":"2026-08-10T17:16:47.490673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.121168Z","title":"Dart: Noise injection for robust imitation learning","venue":null,"work_id":"b31e6694-532b-444c-88ac-698fb967b478","year":2017},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.495655Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:a43e4475d9eda9f730454378c7b7cbd72eb97f7928f4694d402d6eaab85cd3e0","observation_id":"81b6d41c-4923-40d1-8397-0282b6c91ce6","resolution":{"observed_at":"2026-08-10T17:16:48.125866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.107696Z","title":"Autoregressive image generation without vec- tor quantization","venue":null,"work_id":"2e01ef21-26a8-4228-a3f9-61b5c9c436c6","year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.500178Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:9a3df4676a1ab0ca7a78c4992d404387f2392cc97898879014fdaa2eb3fc0673","observation_id":"fcb101ee-7e9c-4071-bc4e-82a394b57b61","resolution":{"observed_at":"2026-08-10T17:16:48.112751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.093249Z","title":"Keep the cost down: A review on methods to opti- mize LLM’s KV-cache consumption","venue":null,"work_id":"9e2a6a7b-e18b-4c47-ad4a-090a088f9129","year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.505391Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:f4dd7c68c8b2b96db7dd249f504d8cfbd69a03b02db48194a77c72e8495e4298","observation_id":"4bc11b39-4bc1-4e78-b94c-91c8ebb49620","resolution":{"observed_at":"2026-08-10T17:16:48.098726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-13T10:28:06.516901Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-10T17:16:47.509903Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.509903Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:3289d86206fc422246cf417e74eb63280d906f373e4affa18d20994e1518b6ea","observation_id":"c565ebda-6104-4ab8-8f56-29cb9a5cc815","resolution":{"observed_at":"2026-08-10T17:16:47.509903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15881","last_updated":"2024-05-24T18:50:27Z","snapshot_observed_at":"2026-08-16T13:49:37.856428Z","submitted_at":"2024-05-24T18:50:27Z","title":"Scaling Diffusion Mamba with Bidirectional SSMs for Efficient Image and Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15881","snapshot_observed_at":"2026-08-10T17:16:47.515030Z","title":"Scaling diffusion mamba with bidirectional ssms for efficient image and video gener- ation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.515030Z"},"links":{"cited_paper":"/paper/2405.15881","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:14b5a05e6d619746e6993776d8342f783479e331ba2caa9075c71f297aded916","observation_id":"c9bd6572-827e-4f82-9b6a-c9a64e551df3","resolution":{"observed_at":"2026-08-10T17:16:47.515030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.079613Z","title":"Cosmos tokenizer","venue":null,"work_id":"d0b2b80c-273d-42d9-8bed-8788258c5b73","year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.519984Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:a7b24b83ed0994ab3b2dd26c16177b6fc27eaa5426e224555c4e4bd3140956c9","observation_id":"8ca12290-9639-49e7-931b-b5d69692e94d","resolution":{"observed_at":"2026-08-10T17:16:48.085171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.066636Z","title":"Improving language understanding by gener- ative pre-training","venue":null,"work_id":"4aeb959f-9823-4146-a2ce-1362ebbc7b10","year":2018},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.524356Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:40a5a43dc412345295df7fdf9abd47de8113c4721504340555f910ab891e63ce","observation_id":"5f30d9b2-3407-4071-95f8-236f20103467","resolution":{"observed_at":"2026-08-10T17:16:48.071303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.052828Z","title":"Language models are unsu- pervised multitask learners","venue":null,"work_id":"3dd88f49-6ea9-4f40-9259-d745a196321a","year":2019},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.528509Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:8c004ba2f425776e2494aa850f6bb9fb48e7f276b1091fa184be39417a0fb3dc","observation_id":"4841542e-b71a-45a4-ba93-583127cb2c90","resolution":{"observed_at":"2026-08-10T17:16:48.057648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-10T17:16:47.533348Z","title":"Ramesh, Mikhail Pavlov, Gabriel Goh, Scott Gray, Chelsea V oss, Alec Radford, Mark Chen, and Ilya Sutskever","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.533348Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:1b567a4539af4f73ac27fcf3e8eee306c279976470ef279f1970333f32bafbab","observation_id":"0fd74360-c00e-47ac-959d-3f07d4277060","resolution":{"observed_at":"2026-08-10T17:16:47.533348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.039396Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"b81db217-064c-492a-bcfe-78c5519bc951","year":2022},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.538415Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:f7bcfdf4542f982143bc5f833e1341ee8a1e2eb7ef6a28f9cd353d39d3495de1","observation_id":"4cfb776c-15b3-4afa-b194-77d3ae117dce","resolution":{"observed_at":"2026-08-10T17:16:48.044619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.025639Z","title":"Generalization in generation: A closer look at exposure bias","venue":null,"work_id":"110b2441-78eb-4e7a-a638-86984d75b733","year":2019},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.542539Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:0307c6aa70c33ed2c1ec86370e351551fcb340a2d4cbf7c0eaf640cbab87643c","observation_id":"1b4086cd-b949-400e-bb3e-e2f776919639","resolution":{"observed_at":"2026-08-10T17:16:48.031417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.012017Z","title":"Mostgan-v: Video generation with temporal motion styles","venue":null,"work_id":"774dd3a3-4546-4bec-87f3-7524e37fdc91","year":2023},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.546816Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:64598345343676db2063b58ea1cef52da933f96032312635f7404f8c109e1b5e","observation_id":"2e1a87e8-e7f9-4084-a594-9a27adf35bb0","resolution":{"observed_at":"2026-08-10T17:16:48.016832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.998040Z","title":"Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2","venue":null,"work_id":"a6bbed66-d1b8-4df4-8a8f-d09d4d4f92ab","year":2022},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.550916Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:fd72f63acc99dc5552a82dc521d9b72b2653da1294a8217bbd9c6a8519bafc83","observation_id":"ab58ef13-103c-403c-a0e1-709477ce37cd","resolution":{"observed_at":"2026-08-10T17:16:48.003201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-10T17:16:47.555283Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.555283Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:997b350b77d1094e3e08e2cbe0acfe88268e867be9622443bd28f5885580b4a8","observation_id":"712eb7b0-13ba-4a16-9873-7280b52418ca","resolution":{"observed_at":"2026-08-10T17:16:47.555283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14224","last_updated":"2024-07-10T09:02:11Z","snapshot_observed_at":"2026-08-16T20:38:15.729152Z","submitted_at":"2024-05-23T06:53:18Z","title":"DiM: Diffusion Mamba for Efficient High-Resolution Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14224","snapshot_observed_at":"2026-08-10T17:16:47.559474Z","title":"Dim: Diffusion mamba for efficient high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.559474Z"},"links":{"cited_paper":"/paper/2405.14224","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:6c178d84087bca8ed3237811d67e672311617dc0b81b4a769d88507ffd9bf665","observation_id":"781189e5-eab2-4e27-972f-02b01933f344","resolution":{"observed_at":"2026-08-10T17:16:47.559474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.15069","last_updated":"2021-04-30T15:38:41Z","snapshot_observed_at":"2026-08-16T18:27:50.672545Z","submitted_at":"2021-04-30T15:38:41Z","title":"A Good Image Generator Is What You Need for High-Resolution Video Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.15069","snapshot_observed_at":"2026-08-10T17:16:47.563491Z","title":"A good image generator is what you need for high-resolution video synthe- sis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.563491Z"},"links":{"cited_paper":"/paper/2104.15069","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:1bb49d67dc44f9b30ac64bc61f7d1025d619f6deb2bb03ecdc0312796cafc58d","observation_id":"b7f2e466-cb66-47fe-b237-27131a2c7756","resolution":{"observed_at":"2026-08-10T17:16:47.563491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.568171Z","title":"Mocogan: Decomposing motion and content for video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.568171Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:2b3a1fcc83b9de06ec3bd9ba6796413d97aa49c1196280dcc54a6b14cabc744a","observation_id":"620a12e9-8525-42e0-833a-bdddd904b986","resolution":{"observed_at":"2026-08-10T17:16:47.568171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-18T04:00:09.136122Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-10T17:16:47.572241Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.572241Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:263e96e1463cec2b862742e5881cbe10306f911389f47a07b94bdcbe547a1038","observation_id":"eb982e26-a697-4d87-bdb8-d9b38f1bf0e4","resolution":{"observed_at":"2026-08-10T17:16:47.572241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-08-14T07:06:06.462400Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-10T17:16:47.576958Z","title":"Diffusion models are real-time game engines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.576958Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:5ff5ac4ff1f6400f7b621e219a4512ff4c466113307f0a102fe3f1a9cbebcb3f","observation_id":"55f9b719-ed24-401f-88fb-51c87abc9ecd","resolution":{"observed_at":"2026-08-10T17:16:47.576958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.977862Z","title":"Neural discrete representation learning","venue":null,"work_id":"18d509f8-bfd9-447d-9fbf-a7faf7359dd4","year":2017},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.581515Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:6a92e15b1dc65a37b3ef415993328007ee14ae3703578ad5c0e8f32b826a4102","observation_id":"6ccbc150-f911-4b07-8925-2c523cbc6894","resolution":{"observed_at":"2026-08-10T17:16:47.983020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.965337Z","title":"Attention is all you need","venue":null,"work_id":"580a87ca-fc61-490c-9eca-6216e839b4d9","year":2017},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.585602Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:83381894b2dfc40ff41ef26cbe074a1656f57b1838cc939c03767fa0506e9d3e","observation_id":"d09973aa-30d3-4d5e-a283-40586f223a62","resolution":{"observed_at":"2026-08-10T17:16:47.969438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.953319Z","title":"Phenaki: Variable length video generation from open domain textual descriptions","venue":null,"work_id":"d1ee593a-9734-4533-8b2a-6bad03a27fbf","year":2022},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.590142Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:78e0fa164071a5c7fda78f0ee5fd484c0d6f382a3a9ec43f5e112996963fdfc2","observation_id":"05191d2d-92ee-447f-bcbf-bb57554b3d3a","resolution":{"observed_at":"2026-08-10T17:16:47.957586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.01950","last_updated":"2021-03-02T18:59:10Z","snapshot_observed_at":"2026-08-16T18:41:46.399000Z","submitted_at":"2021-03-02T18:59:10Z","title":"Predicting Video with VQVAE","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.01950","snapshot_observed_at":"2026-08-10T17:16:47.594537Z","title":"Pre- dicting video with vqvae","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.594537Z"},"links":{"cited_paper":"/paper/2103.01950","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:086ca009913f57f2043368a19da45e756171c9aa448c91c5207c1a8323337e9f","observation_id":"80260792-2f5c-477d-a704-a08243a0995d","resolution":{"observed_at":"2026-08-10T17:16:47.594537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09399","last_updated":"2024-06-13T17:59:26Z","snapshot_observed_at":"2026-08-16T13:43:13.302899Z","submitted_at":"2024-06-13T17:59:26Z","title":"OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09399","snapshot_observed_at":"2026-08-10T17:16:47.599371Z","title":"Omnitokenizer: A joint image-video tokenizer for visual generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.599371Z"},"links":{"cited_paper":"/paper/2406.09399","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:17f1f2b71b0e06b84f85f72c6cdf2a515975f82cb23d4954029886a991eb488d","observation_id":"df6172df-8e15-4382-aa81-bcc7abf63b89","resolution":{"observed_at":"2026-08-10T17:16:47.599371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-10T17:16:47.604165Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.604165Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:3064fa2b6711a85f6c187bc71950b023a948eb7da92e4131e796955e9529bcab","observation_id":"7f39279b-c28e-4617-bd95-c2194542e5bf","resolution":{"observed_at":"2026-08-10T17:16:47.604165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.941809Z","title":"Williams and David Zipser","venue":null,"work_id":"255e11b1-066a-4d71-916a-4380e1d44c24","year":1989},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.608815Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:e908c8a6ef69b05dd57267f2732905e3846b05bf2830cbb9ac04dcd6057478d0","observation_id":"a85941ed-ffd9-4442-a632-1245d13c93db","resolution":{"observed_at":"2026-08-10T17:16:47.945800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.927453Z","title":"N ¨uwa: Visual synthesis pre- training for neural visual world creation","venue":null,"work_id":"4d4ae705-a54d-481a-9621-00edec18a534","year":2022},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.613408Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:3cfb635e9740a891f0b9d9fa9e6172200548fed69c6a3c381ddf9cfeb414b159","observation_id":"8e5f15cc-13c9-4714-9b9c-a9ba42b1bce1","resolution":{"observed_at":"2026-08-10T17:16:47.932679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-17T06:54:13.493934Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-10T17:16:47.617853Z","title":"Videogpt: Video generation using vq-vae and trans- formers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.617853Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:e621bca7e0b4112fa740d2fe91d8067ae89e3a33af52aeb4292157458d8f992d","observation_id":"1a778c2c-eb55-42ff-a069-2a61d8e47074","resolution":{"observed_at":"2026-08-10T17:16:47.617853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.912892Z","title":"Magvit: Masked generative video transformer","venue":null,"work_id":"a214bcf4-0faa-4cf6-afce-df718cad88b5","year":2023},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.622561Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:2f4c217abaaf1b3073a65671ae1db3f636469a732ec5bf16e7c76e46af443f52","observation_id":"f9606f3f-391e-49cf-a136-982f5ac0cdef","resolution":{"observed_at":"2026-08-10T17:16:47.919331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-10T17:16:47.626847Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.626847Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:d87106377a9b160f32ad3f117cef9fca2b7e26e4d8344f0e7f2e2bb528a1e2cb","observation_id":"02f907dd-8d63-440c-8fb2-970dcbbf1b5e","resolution":{"observed_at":"2026-08-10T17:16:47.626847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10571","last_updated":"2022-02-21T23:24:01Z","snapshot_observed_at":"2026-08-16T17:19:40.831695Z","submitted_at":"2022-02-21T23:24:01Z","title":"Generating Videos with Dynamics-aware Implicit Generative Adversarial Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10571","snapshot_observed_at":"2026-08-10T17:16:47.631553Z","title":"Generating videos with dynamics-aware implicit generative adversarial net- works","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.631553Z"},"links":{"cited_paper":"/paper/2202.10571","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:df5ee74c3fa30b148018f35b703b40775b8a89d016158931ded4993bec680270","observation_id":"38ab387c-7f8e-4f81-901f-9c640634f9eb","resolution":{"observed_at":"2026-08-10T17:16:47.631553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.636085Z","title":"Video probabilistic diffusion models in projected latent space","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.636085Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:03e618292d1647dc04a29dd4df2eab24b7f588fe65313e70a312754d2b904486","observation_id":"adb9fa19-0050-4e3e-9ea8-a9e00091d17f","resolution":{"observed_at":"2026-08-10T17:16:47.636085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02448","last_updated":"2019-06-17T11:54:01Z","snapshot_observed_at":"2026-08-14T16:20:00.324943Z","submitted_at":"2019-06-06T07:15:52Z","title":"Bridging the Gap between Training and Inference for Neural Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02448","snapshot_observed_at":"2026-08-10T17:16:47.640589Z","title":"Bridging the gap between training and in- ference for neural machine translation","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.640589Z"},"links":{"cited_paper":"/paper/1906.02448","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:24babc5a5d943ec8187ecafc98048532dcae2d85306492d46dc873d7d1ec1a37","observation_id":"b6517ac2-4092-4ea4-b88b-0c4730de4ddd","resolution":{"observed_at":"2026-08-10T17:16:47.640589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.01340","last_updated":"2018-08-03T20:17:05Z","snapshot_observed_at":"2026-08-15T17:51:24.030376Z","submitted_at":"2018-08-03T20:17:05Z","title":"A Short Note about Kinetics-600","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.01340","snapshot_observed_at":"2026-08-10T17:16:47.415805Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":600,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.415805Z"},"links":{"cited_paper":"/paper/1808.01340","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:7761e7a6fee2b58cd8820ca4f4efa0d9981aa38210fb1dcfeb030044ff4dbf01","observation_id":"e6e7aa42-9bc0-4694-a878-c8052c99a8b8","resolution":{"observed_at":"2026-08-10T17:16:47.415805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 8 inbound Pith citation observations for arXiv:2501.12389."}