{"as_of":"2026-08-20T20:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:35b4011ef928a8163c54f8a1ca9f7793e9ebe8713ea11d82eab451c98189382c","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:16:07.560939Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.13556/citation-record","integrity":"/paper/2608.13556/integrity","json":"/paper/2608.13556/citation-record.json","paper":"/paper/2608.13556"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-14T04:16:07.419865Z","title":"Cosmos world foundation model platform for physical ai.arXiv preprint arXiv:2501.03575,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.419865Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:801fb0a6bec819c83181de22b9c545076219011c2068d5d01eeb1c94d85d1118","observation_id":"e1ff04b0-f62e-4edf-8228-4f445fd41fea","resolution":{"observed_at":"2026-08-14T04:16:07.419865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-08-15T13:40:01.739055Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-14T04:16:07.432474Z","title":"V-JEPA 2: Self-supervised video models enable understanding, prediction and planning.arXiv preprint arXiv:2506.09985,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.432474Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:ce7c469c00b61128f50f6f25224fe1ae5bf19b49efa2a8a9a7b846570574044d","observation_id":"4447f9fa-a3c3-431d-8097-f730f0dfeb96","resolution":{"observed_at":"2026-08-14T04:16:07.432474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-20T09:39:07.545813Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-14T04:16:07.437307Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.437307Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:5a4e221f7a8eb7ae1bd55aa17880a7fec69672f40302cc550bea9f9e84d0e709","observation_id":"bdcfce0e-4edc-4c09-a229-1410ffb3817a","resolution":{"observed_at":"2026-08-14T04:16:07.437307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:08.230608Z","title":"The latent perturbation is used only as a reconstruction-training augmentation; evaluation, latent-statistics estimation, and latent video generation all use clean latents","venue":null,"work_id":"dd8cb35d-812f-4f5a-b164-83ed7ab56baa","year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.556599Z"},"links":{"citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:d3301ead6d487ad41b1bb2a9ae60a7a9923b6b3006dac2b86a0590bf87da0d56","observation_id":"822e9cf7-499b-4321-8c06-45437b1d7d2c","resolution":{"observed_at":"2026-08-14T04:16:08.235615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-15T11:35:18.832923Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-14T04:16:07.449932Z","title":"The kinetics human action video dataset.arXiv preprint arXiv:1705.06950,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.449932Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:13722e8b38a804da2dc68d629ae43a856187d698c10b334645e3eddba9bc9393","observation_id":"7be6db4f-9549-4388-8706-111c5887fa99","resolution":{"observed_at":"2026-08-14T04:16:07.449932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-08-14T12:12:01.418974Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-14T04:16:07.453726Z","title":"Videopoet: A large language model for zero-shot video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.453726Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:31e7b2dac1b9e989cbacd011d80e786778775e98bf71b8abb5f89c7b9ddc6642","observation_id":"c640daf3-f0a5-4252-9f5c-4bb9c82b55b5","resolution":{"observed_at":"2026-08-14T04:16:07.453726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-14T04:16:07.458705Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.458705Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:bd6978ae3a777ed3470d542e63823f530315669f38b6a198eb21bf6531e76a94","observation_id":"4b88751b-242a-4767-b78d-6090785898a2","resolution":{"observed_at":"2026-08-14T04:16:07.458705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.463799Z","title":"Atoken: A unified tokenizer for vision.arXiv preprint arXiv:2509.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.463799Z"},"links":{"citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:ff9ceb7da6f75636a0ec5fcac31e8f0f093a1ea31e92a4222a48a7aaf7c1582c","observation_id":"32c377c0-0683-4177-a23f-c8d74756ed76","resolution":{"observed_at":"2026-08-14T04:16:07.463799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-16T13:20:41.485941Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-14T04:16:07.468746Z","title":"Open-MAGVIT2: An open-source project toward democratizing auto-regressive visual generation.arXiv preprint arXiv:2409.04410,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.468746Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:572b19708dd1482cd75cef080396f378108dfc290adf323b1488fe5b8bdb81a7","observation_id":"1715a996-a8eb-4e7c-93d8-7855af826bc1","resolution":{"observed_at":"2026-08-14T04:16:07.468746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-08-18T01:07:23.737664Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-14T04:16:07.478488Z","title":"Vo, Maximilian Seitzer, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.478488Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:2626499b50dacab4ee2c76fc0c1992ce7551f140a11edc6de5b125f841e39b3d","observation_id":"24aedaf7-f34f-43c1-988b-43d5371d167e","resolution":{"observed_at":"2026-08-14T04:16:07.478488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18324","last_updated":"2026-05-18T12:42:34Z","snapshot_observed_at":"2026-08-20T04:08:02.089607Z","submitted_at":"2026-05-18T12:42:34Z","title":"Improved Baselines with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18324","snapshot_observed_at":"2026-08-14T04:16:07.483649Z","title":"Improved baselines with representation autoencoders.arXiv preprint arXiv:2605.18324,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.483649Z"},"links":{"cited_paper":"/paper/2605.18324","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:64bc8e52b944d8a4ddf22c7818e26418fd97b1b3a45cb0d1b7c72aef5f38a8f5","observation_id":"bce3e1be-f1a3-454b-b373-e8c803aa75d7","resolution":{"observed_at":"2026-08-14T04:16:07.483649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-14T04:16:07.492798Z","title":"UCF101: A dataset of 101 human actions classes from videos in the wild.arXiv preprint arXiv:1212.0402,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.492798Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:515c0038718e63485a2740a920d1fa4e35ab5ad391ecbe185505473c6b060d3f","observation_id":"4c927a75-48a4-446e-a8db-1c66ec61b5ed","resolution":{"observed_at":"2026-08-14T04:16:07.492798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.501394Z","title":"Scaling text-to-image diffusion transformers with representation autoencoders.arXiv preprint arXiv:2601.16208,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.501394Z"},"links":{"citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:2eb50554f23a55dc4a7834534682946665163a67676b230ccf6314572de77a69","observation_id":"1a1d4876-fec9-4f39-b268-392b5243f904","resolution":{"observed_at":"2026-08-14T04:16:07.501394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-14T04:16:07.504838Z","title":"SigLIP 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.504838Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:134f509483f2aec9d8db27d19dd9e905abc0eb698488b6f22e902acf14e8fe2d","observation_id":"dea9f47f-51ca-4dea-94e4-9db511d75c7a","resolution":{"observed_at":"2026-08-14T04:16:07.504838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-18T04:00:09.136122Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-14T04:16:07.509532Z","title":"Towards accurate generative models of video: A new metric and challenges.arXiv preprint arXiv:1812.01717,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.509532Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:8af1946db3377bf25ced84977ad47c02bf14b0972b1c0c91959ae01eff4470bb","observation_id":"6ed848e9-08e3-4044-99f2-b9f7936e713e","resolution":{"observed_at":"2026-08-14T04:16:07.509532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:08.255195Z","title":"Larp: Tokenizing videos with a learned autoregressive generative prior","venue":null,"work_id":"bd99afae-4099-46b2-bdb2-d2699aeb2eba","year":2025},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.518767Z"},"links":{"citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:9061b368e51ef092aeebe60a174bfa316f7d9507295b1514a7305f7d15087b71","observation_id":"0d46f0a2-d88e-4157-87d3-ebf0d5b62093","resolution":{"observed_at":"2026-08-14T04:16:08.260044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-20T01:35:08.027370Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17726","snapshot_observed_at":"2026-08-14T04:16:07.523981Z","title":"Omnitokenizer: A joint image-video tokenizer for visual generation.Advances in Neural Information Processing Systems, 37:28281–28295, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.523981Z"},"links":{"cited_paper":"/paper/2412.17726","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:0179bcddde63770f3b0956fbb8d40a966d8952c671070c9cc66620b538632907","observation_id":"c0fc0f33-5340-4164-8dc2-b8294f5720c0","resolution":{"observed_at":"2026-08-14T04:16:07.523981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05630","last_updated":"2026-05-07T12:30:29Z","snapshot_observed_at":"2026-08-13T17:16:14.184753Z","submitted_at":"2026-03-05T19:39:01Z","title":"Making Reconstruction FID Predictive of Diffusion Generation FID","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05630","snapshot_observed_at":"2026-08-14T04:16:07.532657Z","title":"Making reconstruction fid predictive of diffusion generation fid.arXiv preprint arXiv:2603.05630,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.532657Z"},"links":{"cited_paper":"/paper/2603.05630","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:466aeac01642d8f99ef3431ec28b58a41e3a02d22f05863f48ffbec6ab83290f","observation_id":"5c801366-1054-466b-b96e-bbc3f9721aa7","resolution":{"observed_at":"2026-08-14T04:16:07.532657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:08.243703Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":"d8f3f0cb-3bbb-4fd3-af01-ab6007a0806d","year":2025},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.536617Z"},"links":{"citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:fe02f062d868260355ad6c40160adf560fb4828c4bbaea901c4007d78d2ed07e","observation_id":"e19e2ac3-fd39-4026-88f7-8aa24b5b4913","resolution":{"observed_at":"2026-08-14T04:16:08.247634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-14T04:16:07.540481Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.540481Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:2e27c463a5802789520edd6522dddeb6c5a87b6d8cf0fbe2ac752cc6e0ecace6","observation_id":"07ba8789-d4c7-4792-84dd-94679d813625","resolution":{"observed_at":"2026-08-14T04:16:07.540481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-08-14T04:16:07.544422Z","title":"Representation alignment for generation: Training diffusion transformers is easier than you think.arXiv preprint arXiv:2410.06940,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.544422Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:0252ab705b5a76be3c8df601dfdbcc6274a358cd0b6307d4af9d273629f8dec6","observation_id":"3ce2d571-5fb6-4834-853f-f71141afcf86","resolution":{"observed_at":"2026-08-14T04:16:07.544422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-08-13T23:51:28.874833Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-08-14T04:16:07.548558Z","title":"Diffusion transformers with representation autoen- coders.arXiv preprint arXiv:2510.11690,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.548558Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:88270d33680e7b4f6a3025a00908f6bc373825daf8ff06fb5edabacced0fab9a","observation_id":"d574185f-1288-415a-aa4d-085b3074756b","resolution":{"observed_at":"2026-08-14T04:16:07.548558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.552563Z","title":"Efficient universal perception encoder.arXiv preprint arXiv:2603.22387,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.552563Z"},"links":{"citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:70eecbc3f8aab8a591fd1bceab9b5a6260ad61a75270fb1a14e5528393294248","observation_id":"668e9aa1-a0a4-4e1e-bc87-0ea517977c57","resolution":{"observed_at":"2026-08-14T04:16:07.552563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:08.216213Z","title":"Only the input channel count and corresponding time shift change for EUPE-B","venue":null,"work_id":"03a2f863-29cb-4100-a4c6-6cc1382e3b60","year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.560939Z"},"links":{"citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:1d9f93432b43fda4746af86d9690e5feac14516b759946dc2ab21ec8bf9b5573","observation_id":"f503f54a-b211-4ffd-9eeb-50438244f92e","resolution":{"observed_at":"2026-08-14T04:16:08.221888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.528689Z","title":"Representation entanglement for generation: Training diffusion transformers is much easier than you think.Advances in Neural Information Processing Systems, 38:7714–7743, 2025a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.528689Z"},"links":{"citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:28aa036af2579d9f1d240f3f6253150c35f8fe95d608d983928b3f2ce3e3a17e","observation_id":"4a60b787-5796-4cda-9d61-5ab9045089ec","resolution":{"observed_at":"2026-08-14T04:16:07.528689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-17T06:56:20.644738Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-14T04:16:07.497419Z","title":"RoFormer: Enhanced transformer with rotary position embedding.arXiv preprint arXiv:2104.09864,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.497419Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:d23dd3d8d625f18956d431af1f2a95eae50f9dd8fd0d82fa48cd9455b8f4a661","observation_id":"caceaa4c-1ffa-4ba9-be4c-a72b7725b96e","resolution":{"observed_at":"2026-08-14T04:16:07.497419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.445929Z","title":"Dera: Decoupled representation alignment for video tokenization.arXiv preprint arXiv:2512.04483,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.445929Z"},"links":{"citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:296fed094208bc18f8a1f882d827ff854a0844deff69b04cf69e4176e453d159","observation_id":"a0fe687e-725d-44d6-b5c2-0b3ce4674630","resolution":{"observed_at":"2026-08-14T04:16:07.445929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-14T04:16:07.514157Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.514157Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:8eb3baf5730a60336a4c18b2b3c870aa7653c0eb778b99ae6b0b3a2c58b25093","observation_id":"ddcbd4b4-db9c-40cf-b329-2bc79b53a10b","resolution":{"observed_at":"2026-08-14T04:16:07.514157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.01340","last_updated":"2018-08-03T20:17:05Z","snapshot_observed_at":"2026-08-15T17:51:24.030376Z","submitted_at":"2018-08-03T20:17:05Z","title":"A Short Note about Kinetics-600","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.01340","snapshot_observed_at":"2026-08-14T04:16:07.441723Z","title":"A short note about Kinetics-600.arXiv preprint arXiv:1808.01340,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.441723Z"},"links":{"cited_paper":"/paper/1808.01340","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:2a4b6f3d90929a3cf024d9b4771aa8af16dc20003a9e8ea647ad3fffa7570525","observation_id":"6d972246-bfff-44ac-bf89-e1863b9d3ed9","resolution":{"observed_at":"2026-08-14T04:16:07.441723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14482","last_updated":"2026-06-11T10:07:56Z","snapshot_observed_at":"2026-08-16T02:46:49.800923Z","submitted_at":"2026-03-15T17:02:40Z","title":"V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.14482","snapshot_observed_at":"2026-08-14T04:16:07.473562Z","title":"Unitok: A unified tokenizer for visual generation and understanding.Advances in Neural Information Processing Systems, 38: 129274–129297, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.473562Z"},"links":{"cited_paper":"/paper/2603.14482","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:e364cf211b6441310e4033046fd195185d72df926baf6a8d9075f64ab3af8bf2","observation_id":"4a781aca-ad0e-49de-a977-ae39dad674cd","resolution":{"observed_at":"2026-08-14T04:16:07.473562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:08.269155Z","title":"CoVLA: Comprehensive vision-language-action dataset for autonomous driving","venue":null,"work_id":"591258a8-1d36-44ab-911b-ecd6c577362b","year":1933},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.427895Z"},"links":{"citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:123102ac9476bba3a3bb4584b4d274ff8f028e665efc801272ff06e7e45cfe28","observation_id":"ff700b73-2f1e-4f9f-8c12-40d2fd0a3c5c","resolution":{"observed_at":"2026-08-14T04:16:08.273629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14831","last_updated":"2025-06-06T23:43:53Z","snapshot_observed_at":"2026-08-17T16:18:28.555798Z","submitted_at":"2025-02-20T18:45:44Z","title":"Improving the Diffusability of Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14831","snapshot_observed_at":"2026-08-14T04:16:07.488440Z","title":"Improving the diffusability of autoencoders.arXiv preprint arXiv:2502.14831,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.488440Z"},"links":{"cited_paper":"/paper/2502.14831","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:befac03328af260fe996e19fcaf67ffc415bdd1dfe97c5c10f4618ddaddf5589","observation_id":"83a764d7-a9ff-4c8b-a812-46ac2f97e315","resolution":{"observed_at":"2026-08-14T04:16:07.488440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T08:43:19.923357Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2608.13556."}