{"as_of":"2026-08-07T00:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:47a4cb2de11158d36851ed3992ef87f08070bb29cfd0bf3645cafa32b2117efc","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:23:19.583713Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:01:24.112587Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.16479","snapshot_observed_at":"2026-08-02T05:01:24.112587Z","title":"Latent-compressed variational autoencoder for video diffusion models.arXiv preprint arXiv:2604.16479,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13522","last_updated":"2026-07-15T07:21:00Z","snapshot_observed_at":"2026-08-06T09:52:56.632546Z","submitted_at":"2026-07-15T07:21:00Z","title":"Kepler-Encoder-v0.1: Towards a Multimodal Embedding Model for Robots","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T05:01:24.112587Z"},"links":{"cited_paper":"/paper/2604.16479","citing_paper":"/paper/2607.13522"},"observation_digest":"sha256:1d4821a87ce4ed7344b57c4f70e402cb2400ca5d11f46d744adb8a4b374e92b4","observation_id":"00d907ee-09eb-41de-a468-c6ec1b203ffc","resolution":{"observed_at":"2026-08-02T05:01:24.112587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.16479/citation-record","integrity":"/paper/2604.16479/integrity","json":"/paper/2604.16479/citation-record.json","paper":"/paper/2604.16479"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":"2501.03575","doi":"10.48550/arxiv.2501.03575","metadata_source":"pith","pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cosmos World Foundation Model Platform for Physical AI","venue":"cs.CV","work_id":"a2dba24c-318d-476a-8b21-4289c265810c","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:3d421a0ffb4358ebbe76b2dd6a3cc9eff01400aeddf31c1034050e8b7e80503f","observation_id":"dfed5bca-6fb6-40ee-834b-290c87435230","resolution":{"observed_at":"2026-05-11T10:41:03.061762Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frozen in time: A joint video and image encoder for end-to- end retrieval","venue":null,"work_id":"cd1efa97-e1e0-478b-ad70-02abb141f866","year":2021},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:13c05270c6e511ff9917fc2ae12f82abd13869708a73c74a974539e13eec1900","observation_id":"299ca983-65ea-478c-a38d-a9abea0c6237","resolution":{"observed_at":"2026-05-18T02:32:20.016766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:eee0ef9572d80cbb3a47ca536a8f598b7e982f061cbf633c21b82859b66aa7a9","observation_id":"62de98d4-5b97-4e57-a82c-1cc21d72cc0f","resolution":{"observed_at":"2026-05-11T10:41:03.273409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video generation models as world simulators","venue":null,"work_id":"ad3ec4e6-4ddb-4e4f-a791-1cc6bd1b9aac","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:c4ef2f191b19d534b9d99e4ed57d9879972bd98c8fbe3d8cab4c6c879593a027","observation_id":"62664a9d-9ae2-49f5-b8a0-7593a75b9d30","resolution":{"observed_at":"2026-05-18T02:32:20.022196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10733","last_updated":"2025-05-18T21:17:22Z","snapshot_observed_at":"2026-07-06T19:33:12.610676Z","submitted_at":"2024-10-14T17:15:07Z","title":"Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models","version":8},"cited_work":{"arxiv_id":"2410.10733","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10733","snapshot_observed_at":"2026-07-09T07:06:02.921871Z","title":"Deep compression autoencoder for efficient high-resolution diffusion models","venue":"cs.CV","work_id":"fb6e768c-674c-4587-921d-4c0ad09a87fd","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2410.10733","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:06d0aad53db4e805b11cb93305c152995d6b70c3cbc9609595ac9922b94aed98","observation_id":"20901210-6fd1-41c5-b864-9ae3cf45ed07","resolution":{"observed_at":"2026-05-11T10:41:03.226989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25182","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:07:45.168345Z","title":"Dc-videogen: Efficient video gen- eration with deep compression video autoencoder","venue":null,"work_id":"9e08b3a1-d003-44e0-88e6-d710a4965842","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:f626cf67eff6825837f8e035460d28fd26135b60fe2732b06a53723d1a0346db","observation_id":"9ef849ae-98c7-451d-abc4-c3364675db64","resolution":{"observed_at":"2026-05-11T10:41:03.083637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dc-ae 1.5: Accelerating dif- fusion model convergence with structured latent space","venue":null,"work_id":"b3d30280-39d8-4835-acb0-9a4bc5fd8f16","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:00be8c18848debcee1c080c89c651312ed4ec7dd69792960c1192f8a3628369d","observation_id":"bd28493f-3edb-4436-b076-4de25ed501f4","resolution":{"observed_at":"2026-05-18T02:32:20.024781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Od- vae: An omni-dimensional video compressor for improving latent video diffusion model","venue":null,"work_id":"43fef6f3-3e14-43ed-9396-b32b5b863f45","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:130ed054e4d139bcdc0b28a3c3a1e2f21e7994ac9db6743c1cfd8a428cdbc284","observation_id":"a95f81c1-9a04-4660-8bdb-7c43a13f9e54","resolution":{"observed_at":"2026-05-18T02:32:20.027418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Panda-70m: Captioning 70m videos with multiple cross- modality teachers","venue":null,"work_id":"eef85965-f370-4955-9158-c93a2eb63526","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:7d9be0f951b2ceedacc63fbe73c2aa30d5c79b1d86c4baddb5a153a21b21b839","observation_id":"6d4affe2-e4f6-4c8b-9a5f-4db35d603316","resolution":{"observed_at":"2026-05-18T02:32:20.029737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"f90be29f-e77b-4d7d-82ee-9a9a090acf24","year":2021},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:f775028c16373327f44b53e807dce0a05575f2fcfdbe2124a9cb2cdb7e836a41","observation_id":"6d9acdb6-ad50-4c36-8fac-137715dc5cf9","resolution":{"observed_at":"2026-05-18T02:32:20.031995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video generation arena leader- board","venue":null,"work_id":"e356dfb8-2222-40bd-be22-b54442c54a87","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:fc7b7eff9a103e152ddd86c28911ce7742e252861ba9c94a9075f7c4987b593a","observation_id":"b718b1df-7e54-4312-935b-527521294bf7","resolution":{"observed_at":"2026-05-18T02:32:20.064237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09113","last_updated":"2025-06-28T11:58:23Z","snapshot_observed_at":"2026-08-01T16:09:18.068564Z","submitted_at":"2025-06-10T17:56:11Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","version":2},"cited_work":{"arxiv_id":"2506.09113","doi":"10.48550/arxiv.2506.09113","metadata_source":"pith","pith_arxiv_id":"2506.09113","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","venue":"cs.CV","work_id":"b2e36b5d-99e4-45b4-9358-64f6d3501983","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2506.09113","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:4de8dfc3e8d7cefd97591b1d4da6802abde95749531312afc0efd36cf52a42ca","observation_id":"5688cdf8-fe5f-463c-b86c-14fdcb0ff23d","resolution":{"observed_at":"2026-05-11T12:09:57.662354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative adversarial nets.Advances in Neural Information Processing Systems, 27","venue":null,"work_id":"3a302cc1-1680-48f5-abd6-90f29b054f71","year":2014},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:2323149edc7f0ee79e6197df909e4ce7591e0eddf9ace670d33e10fe2ab41349","observation_id":"fe0fc68e-b065-4cca-bed9-cdce1f5c7ed0","resolution":{"observed_at":"2026-05-18T02:32:20.061886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An introduction to wavelets.IEEE computa- tional science and engineering, 2(2):50–61","venue":null,"work_id":"ffc0d9cd-0ec2-42b0-811b-62dfc55350a6","year":1995},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:24359de4ed89f651da15c0d7ec3479d20fb799c911b6acd63bf1d08c911e356b","observation_id":"019c6939-0c20-44b8-ab20-4cf7bd6e40e6","resolution":{"observed_at":"2026-05-18T02:32:20.066750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":"2307.04725","doi":"10.48550/arxiv.2307.04725","metadata_source":"pith","pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","venue":"cs.CV","work_id":"1f9d1d3b-a6d6-45a9-9f13-51393c03be8a","year":2023},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:926df7271225ad10f06b9fc5b7401afd39d75ebf99317ce6d921bf19b6f891b8","observation_id":"379c8280-c1fa-4db6-8b19-b58afae57b6f","resolution":{"observed_at":"2026-05-11T10:41:03.030009Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":"2501.00103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-07-09T07:56:04.699528Z","title":"LTX-Video: Realtime Video Latent Diffusion","venue":"cs.CV","work_id":"cee5c521-3ce9-466e-a035-1e42f89254f4","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:8c858fbb356bf5dded651c088bc518132792a02942bf3ec61e8f7bd005b2eb25","observation_id":"1b6693c7-a193-487d-a603-9726cd377731","resolution":{"observed_at":"2026-05-11T10:41:03.364378Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09755","last_updated":"2025-01-16T18:59:04Z","snapshot_observed_at":"2026-07-06T20:22:09.358394Z","submitted_at":"2025-01-16T18:59:04Z","title":"Learnings from Scaling Visual Tokenizers for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":"2501.09755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09755","snapshot_observed_at":"2026-07-07T15:43:53.781661Z","title":"Learnings from scaling visual tokenizers for reconstruction and generation","venue":"cs.CV","work_id":"b198a6f3-7796-4bb9-ab48-da1ef827995f","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2501.09755","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:e31ea6c71d33cfeaa215322f77dc81300d7d138c987c4aa34579af97b0dc08b1","observation_id":"ac0c1624-78af-40ce-9719-35b212adf4b2","resolution":{"observed_at":"2026-05-11T10:41:03.077326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:56d3076701f871329221ad1e35d0602d7d0086c909b93149e7779eba510f53ee","observation_id":"1f1b6ae9-bb4e-4dc1-b469-8e31eb10843c","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"simple diffusion: End-to-end diffusion for high resolution images","venue":null,"work_id":"eb185840-10ed-40ac-8277-81be9ac56811","year":2023},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:d34d9b4d0cbeff4a8d90836b66c40a242da4dcff2238527625b218cdd26cd4ae","observation_id":"2e8e02ed-5c3f-4c03-9a86-dba9533f73c5","resolution":{"observed_at":"2026-05-18T02:32:20.070341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image quality metrics: Psnr vs","venue":null,"work_id":"7994b381-9e1a-4af6-bdcf-913f1ae7dbab","year":2010},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:90330beac07d06c222ca88245fddbd63bb1a5db2e02702a5cb2ea459f0ddf925","observation_id":"2c9a178d-1bb3-46f4-add7-f34f44d93e5c","resolution":{"observed_at":"2026-05-18T02:32:20.079767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":"1705.06950","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-07-09T11:16:11.423695Z","title":"The Kinetics Human Action Video Dataset","venue":"cs.CV","work_id":"c8a3de61-cfd3-4aeb-bcf7-a0372c015748","year":2017},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:493f404250b1d20b7cfefa10f959c3f1d1cfae883518cc2c9340732bc4c8df48","observation_id":"f3c9203b-3fe4-4318-93c9-3c3577e834cd","resolution":{"observed_at":"2026-05-11T10:41:03.295921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:6bd844e200459d06d469483aad0a26a9ed3a602159e7302f5796b259283757e3","observation_id":"7325a249-a7d9-48c0-a616-17cfd1c12dd2","resolution":{"observed_at":"2026-05-11T10:41:03.177123Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":"1312.6114","doi":"10.2139/ssrn.4269703","metadata_source":"pith","pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Auto-Encoding Variational Bayes","venue":"stat.ML","work_id":"97d95295-30e1-42b4-bbf6-85f0fa4edb44","year":2013},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:2c86fb1505e865c89b95971650707512bf56eb5a94a25b123a546a0b0cf80e09","observation_id":"b8adbe17-00c9-478a-890c-41f63f0d2cc7","resolution":{"observed_at":"2026-05-11T10:41:03.044934Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":"2312.14125","doi":"10.48550/arxiv.2312.14125","metadata_source":"pith","pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","venue":"cs.CV","work_id":"5cc3572d-7e2f-4431-ae42-d9282a42a800","year":2023},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:b9085cab42869bf568e1f66620fd45bad73963bfeb96ea9db905b9a0bc118fc0","observation_id":"d8789e48-97b0-4e7a-b65d-b281bf12358b","resolution":{"observed_at":"2026-05-15T17:51:05.830483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:7a1d27ab6e3ba38dec65109e7bbd41029d0dbc24a375dedc20305fbf16a90a85","observation_id":"2bca163d-c335-4628-b5b3-037118c5bc6a","resolution":{"observed_at":"2026-05-11T10:41:03.018392Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video autoencoder: self-supervised disentanglement of static 3d structure and motion","venue":null,"work_id":"435f9810-85c5-4c25-9a7c-8a2bfd1fdc28","year":2021},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:5deb552106334dbc2889e46866d92ee4e945046df6ffea807b9699dff35616be","observation_id":"45ba7cd5-1331-4cd5-8f01-3c90311fa8b0","resolution":{"observed_at":"2026-05-18T02:32:20.056940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wf-vae: Enhancing video vae by wavelet-driven energy flow for latent video diffusion model","venue":null,"work_id":"4720b139-b5ab-4ce2-849c-e7004263b2e4","year":null},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:edafef910fea8eb01c114f60dc5abe2ff36868ccb0550e0dd70f1eadb267b993","observation_id":"d5a3f91a-7680-48b3-8914-5bd17281410f","resolution":{"observed_at":"2026-05-18T02:32:20.044026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":"2412.00131","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-07-08T14:44:59.776032Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","venue":"cs.CV","work_id":"51c0ab25-66f7-4d1a-a028-86b9b1b9e313","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:378f7f272fe61456ebf565e505dc0b9f14658e6ede58933e1b62d4db4ffb3852","observation_id":"8353aabe-6aa1-4242-8a43-366ddb86beb0","resolution":{"observed_at":"2026-05-11T10:41:03.345396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07136","last_updated":"2025-06-08T13:30:11Z","snapshot_observed_at":"2026-07-06T21:38:39.914904Z","submitted_at":"2025-06-08T13:30:11Z","title":"Hi-VAE: Efficient Video Autoencoding with Global and Detailed Motion","version":1},"cited_work":{"arxiv_id":"2506.07136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07136","snapshot_observed_at":"2026-07-03T20:28:55.564481Z","title":"Hi-vae: Ef- ficient video autoencoding with global and detailed motion","venue":null,"work_id":"1585ed10-85b0-43a2-9212-64e0f2a8818f","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2506.07136","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:e186c85837a7b98c30945eff346cc564016002f05e267c15c62d0345d89dee53","observation_id":"59b3d51f-4e21-4d0a-9cba-4fba4daa9806","resolution":{"observed_at":"2026-05-11T10:41:03.093142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:fa37b4a04e5eaa56d6e7e6ae9c8b1e4010e000f54b4cfb36f1a8852ba39693b5","observation_id":"78409137-931e-4603-9148-3cdba8c041a7","resolution":{"observed_at":"2026-05-11T10:41:03.316506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Latte: Latent diffusion transformer for video generation.Transactions on Machine Learning Research","venue":null,"work_id":"29429d6c-966d-430d-8e6f-d350e37cde73","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:d14777e5623e59a05773720969592ce887cfab7d6bdc5c8dd3a4d626cba9971a","observation_id":"4c32aa39-611f-420a-95df-449cd8b044ca","resolution":{"observed_at":"2026-05-18T02:32:20.051289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-06T12:43:20.523348Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":"2407.02371","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-07-05T16:41:18.954519Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","venue":"cs.CV","work_id":"00dd95a8-d503-4a41-9603-785dcf4a0b8e","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:0250910c0388102f3cecece3621c7bf0b38cbc157a09e3b1cd2f0cb7704f1107","observation_id":"ba2dd2a9-6785-41a6-a0ce-e476e6b03df6","resolution":{"observed_at":"2026-05-14T20:34:53.267725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:66a85c7ff9a1f0004b37beb453a626cdca0df20a2bc289bba9ccc4e2ffabb755","observation_id":"8114c507-9fcb-43bf-835d-136e00231656","resolution":{"observed_at":"2026-05-11T14:16:26.778393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"d8ffd5d8-a10b-407a-a9ce-946305796008","year":2022},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:0d6f78e67ee35013b66b1b62652be5e8ace95cb46423523f428c9642b9814d93","observation_id":"5c6fce5f-89e4-4c23-b771-5806db933590","resolution":{"observed_at":"2026-05-18T02:32:20.074653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporal generative adversarial nets with singular value clipping","venue":null,"work_id":"277c75f0-2723-46df-a098-4fa3beea49ac","year":2017},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:444842d2c460c3eb72bd245f2b9d7c30c576ef38708261aa405ff755b7f985bf","observation_id":"4010fa6e-836f-40a9-a49b-d47def46bd88","resolution":{"observed_at":"2026-05-18T02:32:20.046459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The JPEG 2000 still image compression standard","venue":null,"work_id":"9654dac3-f81d-4098-9a5f-a57a9f4e1618","year":2000},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:dd9d77fb2b703f65cd5bcd0d107f7a5254b06173eae3e57032c686536390773a","observation_id":"d4c993ac-391b-4521-bcc5-67f7c7a4aca3","resolution":{"observed_at":"2026-05-18T02:32:20.054174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2","venue":null,"work_id":"2ace92a7-3c37-4118-b9f9-09bd61444d45","year":2022},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:d5590a9584c66904e8bf432a37b0bf64caaeef0fc7b6cb56f89b12cd12db57e1","observation_id":"e3fbc601-646c-47c6-a677-8c997a906602","resolution":{"observed_at":"2026-05-18T02:32:20.048897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14831","last_updated":"2025-06-06T23:43:53Z","snapshot_observed_at":"2026-07-06T20:39:57.316580Z","submitted_at":"2025-02-20T18:45:44Z","title":"Improving the Diffusability of Autoencoders","version":3},"cited_work":{"arxiv_id":"2502.14831","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.14831","snapshot_observed_at":"2026-07-04T16:59:58.004889Z","title":"Improving the diffusability of autoencoders","venue":null,"work_id":"68095bbe-b8a6-4304-baab-6153bba7a4c1","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2502.14831","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:a3d0407a727278c50158041c1f8874fe073a43574c86f08758de862e6dca643f","observation_id":"22b7c1fa-f686-4732-a324-d4e83df66dfe","resolution":{"observed_at":"2026-05-11T10:41:03.024402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":"1212.0402","doi":"10.48550/arxiv.1212.0402","metadata_source":"pith","pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","venue":"cs.CV","work_id":"5dfb46e7-e952-409d-a3c7-ba7f20aebad6","year":2012},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:cc0df5f19d4e76326ff3253c04cd11faab27e66319e08763f13d859172bd8978","observation_id":"14da305a-1bd1-4404-9fc6-e7b623cbfa84","resolution":{"observed_at":"2026-05-11T10:41:03.251740Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07195","last_updated":"2025-08-10T06:06:19Z","snapshot_observed_at":"2026-08-05T22:18:25.664466Z","submitted_at":"2025-08-10T06:06:19Z","title":"Adapting LLMs to Time Series Forecasting via Temporal Heterogeneity Modeling and Semantic Alignment","version":1},"cited_work":{"arxiv_id":"2508.07195","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07195","snapshot_observed_at":"2026-07-02T22:27:26.593716Z","title":"Adapting LLMs to time series forecasting via temporal het- erogeneity modeling and semantic alignment","venue":null,"work_id":"86d50fe8-b9c0-4bbd-97bb-e8f27bfda5d0","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2508.07195","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:c5ea3004f3278dead417983965e9f4d60c93d775b2146e90f8ca471df24facb2","observation_id":"b5459e31-b2f8-4ed5-a603-69b9b53627d4","resolution":{"observed_at":"2026-05-11T10:41:03.307568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1010.4084","last_updated":"2010-10-20T01:52:05Z","snapshot_observed_at":"2026-07-06T02:17:55.479578Z","submitted_at":"2010-10-20T01:52:05Z","title":"Haar Wavelet Based Approach for Image Compression and Quality Assessment of Compressed Image","version":1},"cited_work":{"arxiv_id":"1010.4084","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1010.4084","snapshot_observed_at":"2026-07-04T18:11:21.620230Z","title":"Haar wavelet based approach for image compression and quality assess- ment of compressed image.arXiv preprint arXiv:1010.4084","venue":null,"work_id":"3a7c55f7-2aab-492a-b00e-4d68636e4e79","year":null},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/1010.4084","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:6b342bc91a01e62ca08f793cef336bd8058dccaec30e1e0b27d82956773f1513","observation_id":"e5292539-05bd-4aab-a127-72e04750685d","resolution":{"observed_at":"2026-07-04T18:11:21.620230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FVD: A new metric for video generation","venue":null,"work_id":"3c4fa128-f5f5-4ba8-9a22-b49c6b62353c","year":2019},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:1ef89e79b9f8afc5a159d2269b8f1338f0d9ffa07e3e926859e5478455917f77","observation_id":"75ce7ae5-0377-4ea9-b494-9c7b4ea5a487","resolution":{"observed_at":"2026-05-18T02:32:20.014436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need.Advances in Neural Information Processing Systems, 30","venue":null,"work_id":"a6aa0b6c-5262-47f8-b1cf-f7233168aa95","year":2017},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:88e6162be08746d741401880b23503d4c030f05419e43cb50442aea9bfae86ac","observation_id":"7a42e7d1-a736-4ea2-b3b7-2ef1d992341c","resolution":{"observed_at":"2026-05-18T02:32:20.018956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:224e1c6cb285ea2f81b35e6856e55e2ad971bf304abfe584fc1393217d5fcc41","observation_id":"1d8fd16f-127a-4aa7-89ac-9dd60d02c1db","resolution":{"observed_at":"2026-05-11T10:41:03.215355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:02:58.874726Z","title":"Image quality assessment: from error visibility to structural similarity.IEEE Transactions on Image Processing, 13(4):600–612","venue":null,"work_id":"832f6be1-709d-43a5-9863-2da7232507e6","year":2004},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:d18b16660dc75a0ea23a64dff76bcefe3ad93589355cf98b82e37d271903cd20","observation_id":"718de5d1-f640-48e9-b5ef-ad0c8738b35f","resolution":{"observed_at":"2026-05-18T02:32:20.036895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved video V AE for latent video diffusion model","venue":null,"work_id":"7e64db3c-a131-47f7-b66f-66ed8a3eea87","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:e14ef421f14ef35972b3fdbf7e42aa9817eae5059e5145ca3a0d1436b3194c66","observation_id":"f00a44cd-fde9-42b1-8786-25d8e2eae49f","resolution":{"observed_at":"2026-05-18T02:32:20.041693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.10567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:36:27.557856Z","title":"H3ae: High compression, high speed, and high quality autoencoder for video diffusion models","venue":null,"work_id":"9ebe9298-b066-41ec-940a-20dbe4f2f8a1","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:faf51d2e56fc69658154cb7a00b7e97fc6be64d51860b72094774d28d847b01c","observation_id":"c279d6c0-affa-4d50-842d-6f4cecb259e9","resolution":{"observed_at":"2026-05-11T10:41:03.162685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to generate time-lapse videos using multi-stage dy- namic generative adversarial networks","venue":null,"work_id":"92599231-042e-4892-ac45-69ea00c863c1","year":2018},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:a92797a0106351c73da4bde8fa655c4403fe340f606ff52c3d243c90585c3935","observation_id":"3f1f18fe-4366-4385-8537-b9c8b50e29db","resolution":{"observed_at":"2026-05-18T02:32:20.034424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:0c958740c61466c9a3e2765a5f6bed1598a0313a75cfaee5f9b1d7c6ae18cfe9","observation_id":"5636f674-a34d-423c-93c8-18822b8e2238","resolution":{"observed_at":"2026-05-11T10:41:03.053184Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:07d7f6ecfdf1a8013b24eb8303fb5a3e255d2f438e680240498832e5d164d4ae","observation_id":"77bafbe1-84b6-488a-acff-59a4c5739655","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14148","last_updated":"2024-03-21T05:48:48Z","snapshot_observed_at":"2026-07-06T17:48:08.016138Z","submitted_at":"2024-03-21T05:48:48Z","title":"Efficient Video Diffusion Models via Content-Frame Motion-Latent Decomposition","version":1},"cited_work":{"arxiv_id":"2403.14148","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.14148","snapshot_observed_at":"2026-07-03T20:28:55.535457Z","title":"Effi- cient video diffusion models via content-frame motion-latent decomposition","venue":null,"work_id":"d262800e-d0e2-4bf8-ac7e-255fab126f46","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2403.14148","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:fd859fb831ff67fae0404bbd3e53a854bd629e2d7bc5ee494070996b50e2797a","observation_id":"1c000e58-fda9-4a7a-a9b9-0108e4c15c48","resolution":{"observed_at":"2026-05-11T10:41:03.353140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"fa51ebaf-d561-4c4c-89e3-c9f3041a555e","year":2018},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:4ccb221b1990af3e85117db3f9b22923b5c3ace1571eaf0e9b9590c0f67cd236","observation_id":"8c7ce93b-2f00-4337-a11b-2cfeeed89b72","resolution":{"observed_at":"2026-05-18T02:32:20.039061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on perceptually optimized video coding","venue":null,"work_id":"806600e6-ec73-4d14-9d5a-b40ce9371fee","year":2023},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:3298d053e9dad309891aeb1ecb51f271edbc83f57c0595cee2077a2f7b739f71","observation_id":"b0cd959c-cd32-423a-819f-a2579642c43c","resolution":{"observed_at":"2026-05-18T02:32:20.059288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cv- vae: A compatible video vae for latent generative video mod- els.Advances in Neural Information Processing Systems, 37: 12847–12871","venue":null,"work_id":"3d694347-8ad3-46fa-9ad9-2e476997b261","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:67ff9eee8588f3aa4a3c791474cac4f0baed1db9dd914b71854eda88db742e9c","observation_id":"5a609579-f837-4fd6-9024-cd913e77c140","resolution":{"observed_at":"2026-05-18T02:32:20.077188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":"2412.20404","doi":"10.48550/arxiv.2412.20404","metadata_source":"pith","pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-Sora: Democratizing Efficient Video Production for All","venue":"cs.CV","work_id":"8b29ba7b-3d84-4281-85b7-9eaf905afd7f","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:a95adffa57851374938de5329c3c9343de206f73c5e48b005152e087d4becc31","observation_id":"192448e4-2953-4271-bbb2-8cd6066d7af5","resolution":{"observed_at":"2026-05-11T12:01:52.219350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15458","last_updated":"2024-10-20T17:51:35Z","snapshot_observed_at":"2026-07-06T19:36:41.445591Z","submitted_at":"2024-10-20T17:51:35Z","title":"Allegro: Open the Black Box of Commercial-Level Video Generation Model","version":1},"cited_work":{"arxiv_id":"2410.15458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.15458","snapshot_observed_at":"2026-07-03T23:59:06.234618Z","title":"Allegro: Open the black box of commercial-level video generation model","venue":null,"work_id":"2a9fb750-b69a-4cb3-bd82-2a77e49bd173","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2410.15458","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:4feb64e3875ca36497f8b2a9ee88c3ad070b8c57155b0599bc5c4004d711a23e","observation_id":"f16c48cd-0194-4afb-9b9a-68c00bc42e9e","resolution":{"observed_at":"2026-05-11T10:41:03.125071Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":29,"verified_fuzzy":26},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 1 inbound Pith citation observation for arXiv:2604.16479."}