{"as_of":"2026-08-09T18:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:80175e0f83d3fae291f20debf113e6627f323d387d7922c055bbd78725d1adf3","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:15:18.581949Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:50:03.947151Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:49:44.825271Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03065","snapshot_observed_at":"2026-08-03T20:30:26.075671Z","title":"Sparse-vdit: Unleashing the power of sparse attention to accelerate video diffusion transformers.arXiv preprint arXiv:2506.03065, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-07T03:18:48.553937Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:26.075671Z"},"links":{"cited_paper":"/paper/2506.03065","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:d3c93be1a112ab3e5b3ff7060ebd6995d1266569b80d5fc8ceb9b78feaead89a","observation_id":"5588daa0-1b4c-4c7b-a408-50218720e742","resolution":{"observed_at":"2026-08-03T20:30:26.075671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03065","snapshot_observed_at":"2026-08-03T15:35:13.213540Z","title":"Sparse-vdit: Unleashing the power of sparse attention to accelerate video diffusion transformers.arXiv preprint arXiv:2506.03065, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:13.213540Z"},"links":{"cited_paper":"/paper/2506.03065","citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:ada708d7575d1620b609043ed2e585d104c55c7693207c45f9758e918366d715","observation_id":"67a6f03d-8ad4-450c-a056-0638d32f6739","resolution":{"observed_at":"2026-08-03T15:35:13.213540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03065","snapshot_observed_at":"2026-08-03T10:37:47.271073Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11641","last_updated":"2026-07-01T07:39:26Z","snapshot_observed_at":"2026-08-09T09:19:00.994532Z","submitted_at":"2026-01-14T16:25:39Z","title":"Mixture of Distributions Matters: Dynamic Sparse Attention for Efficient Video Diffusion Transformers","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T10:37:47.271073Z"},"links":{"cited_paper":"/paper/2506.03065","citing_paper":"/paper/2601.11641"},"observation_digest":"sha256:2daca320a62064e575c763118209e8c7a19563793e1b92c9b26f7cae2f7a8cb3","observation_id":"1a628508-83c3-47b5-a8ac-a9d5b7d00b11","resolution":{"observed_at":"2026-08-03T10:37:47.271073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2506.03065","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03065","snapshot_observed_at":"2026-07-04T09:49:44.825271Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers, June 2025","venue":null,"work_id":"8ff929a3-a68f-4193-909e-1b19fbdb4f57","year":2025},"citing_paper":{"arxiv_id":"2604.12219","last_updated":"2026-04-14T02:51:52Z","snapshot_observed_at":"2026-07-06T23:00:28.036409Z","submitted_at":"2026-04-14T02:51:52Z","title":"Ride the Wave: Precision-Allocated Sparse Attention for Smooth Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:20:29.350915Z"},"links":{"cited_paper":"/paper/2506.03065","citing_paper":"/paper/2604.12219"},"observation_digest":"sha256:ceb6938780975778898bc7acd103fb157ac1db6d4c8442d0b627cc8746a6ab41","observation_id":"72a290b8-0d04-49ef-85a3-f30d74098ea3","resolution":{"observed_at":"2026-05-11T10:46:02.769647Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2506.03065","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03065","snapshot_observed_at":"2026-07-04T09:49:44.825271Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers, June 2025","venue":null,"work_id":"8ff929a3-a68f-4193-909e-1b19fbdb4f57","year":2025},"citing_paper":{"arxiv_id":"2604.15911","last_updated":"2026-04-17T10:11:39Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:11:39Z","title":"Efficient Video Diffusion Models: Advancements and Challenges","version":1},"reference_index":238,"source":"pdf_text","source_observed_at":"2026-05-10T08:28:29.706249Z"},"links":{"cited_paper":"/paper/2506.03065","citing_paper":"/paper/2604.15911"},"observation_digest":"sha256:e801de25a0e8b345938a746c07b184697cff35b3cc05d960a7942dfe25bdc1c5","observation_id":"fcf2776e-34b9-4b9b-96c2-553a28bf05a7","resolution":{"observed_at":"2026-05-10T09:03:25.984657Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2506.03065","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03065","snapshot_observed_at":"2026-07-04T09:49:44.825271Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers, June 2025","venue":null,"work_id":"8ff929a3-a68f-4193-909e-1b19fbdb4f57","year":2025},"citing_paper":{"arxiv_id":"2605.14513","last_updated":"2026-05-14T07:57:55Z","snapshot_observed_at":"2026-08-02T01:59:59.234796Z","submitted_at":"2026-05-14T07:57:55Z","title":"HASTE: Training-Free Video Diffusion Acceleration via Head-Wise Adaptive Sparse Attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T05:17:48.403406Z"},"links":{"cited_paper":"/paper/2506.03065","citing_paper":"/paper/2605.14513"},"observation_digest":"sha256:4df672c213876b2dc59956e4a1fa6a8f0c555273d9a19d6116e18984c17919b2","observation_id":"c509e37d-a7a3-44e1-bc6f-91d1390c36b5","resolution":{"observed_at":"2026-05-15T05:19:46.210669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2506.03065","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03065","snapshot_observed_at":"2026-07-04T09:49:44.825271Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers, June 2025","venue":null,"work_id":"8ff929a3-a68f-4193-909e-1b19fbdb4f57","year":2025},"citing_paper":{"arxiv_id":"2605.30325","last_updated":"2026-05-28T17:57:07Z","snapshot_observed_at":"2026-07-06T23:39:38.845840Z","submitted_at":"2026-05-28T17:57:07Z","title":"Veda: Scalable Video Diffusion via Distilled Sparse Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T07:54:13.390911Z"},"links":{"cited_paper":"/paper/2506.03065","citing_paper":"/paper/2605.30325"},"observation_digest":"sha256:f91a3d6d8d9e8ae51a8913ffc741b00f3bd5797ff3716c06b3859f2cd01dcd5c","observation_id":"1f7c32e5-9011-4239-949e-e4e86e825e2c","resolution":{"observed_at":"2026-06-29T08:03:14.729248Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2506.03065","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03065","snapshot_observed_at":"2026-07-04T09:49:44.825271Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers, June 2025","venue":null,"work_id":"8ff929a3-a68f-4193-909e-1b19fbdb4f57","year":2025},"citing_paper":{"arxiv_id":"2606.01399","last_updated":"2026-05-31T18:45:11Z","snapshot_observed_at":"2026-07-06T23:41:58.121923Z","submitted_at":"2026-05-31T18:45:11Z","title":"PAI-Studio: Cinematic Video Background Replacement with Camera-Aware Motion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T17:14:23.336848Z"},"links":{"cited_paper":"/paper/2506.03065","citing_paper":"/paper/2606.01399"},"observation_digest":"sha256:9b36f8f7e417c6095063ccc5d638c1e4ff2c2cbcd614f1d9d685699e58bbcd71","observation_id":"53268387-2a8c-422e-81a0-a77bba15a33d","resolution":{"observed_at":"2026-07-01T21:16:14.715737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2506.03065","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03065","snapshot_observed_at":"2026-07-04T09:49:44.825271Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers, June 2025","venue":null,"work_id":"8ff929a3-a68f-4193-909e-1b19fbdb4f57","year":2025},"citing_paper":{"arxiv_id":"2606.01556","last_updated":"2026-06-01T02:02:12Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T02:02:12Z","title":"TwinQuant: Learnable Subspace Decomposition for 4-Bit LLM Quantization","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-28T13:07:53.001390Z"},"links":{"cited_paper":"/paper/2506.03065","citing_paper":"/paper/2606.01556"},"observation_digest":"sha256:34d71d4e8d2a287d751647c806b9ba4b11f03cc4357b7f56c623183299485967","observation_id":"3cb0ef35-9ca6-45fa-9632-d9a643d66168","resolution":{"observed_at":"2026-07-02T00:56:24.913950Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2506.03065","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03065","snapshot_observed_at":"2026-07-04T09:49:44.825271Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers, June 2025","venue":null,"work_id":"8ff929a3-a68f-4193-909e-1b19fbdb4f57","year":2025},"citing_paper":{"arxiv_id":"2606.23019","last_updated":"2026-06-22T08:32:07Z","snapshot_observed_at":"2026-07-31T17:52:55.153198Z","submitted_at":"2026-06-22T08:32:07Z","title":"ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-26T09:22:55.731241Z"},"links":{"cited_paper":"/paper/2506.03065","citing_paper":"/paper/2606.23019"},"observation_digest":"sha256:4094c5bc58d3ce9e95ac69cd4c786fd3219c840faf5446a0493d52254dd4f6ed","observation_id":"2250f170-1136-4b46-9d7c-fa8567d37eb4","resolution":{"observed_at":"2026-07-04T09:49:44.826596Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03065","snapshot_observed_at":"2026-08-05T20:50:03.947151Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03335","last_updated":"2026-08-04T08:47:57Z","snapshot_observed_at":"2026-08-08T15:40:55.073428Z","submitted_at":"2026-08-04T08:47:57Z","title":"SPADE: An Input-Adaptive Sparse Attention Engine for Fast Video Diffusion Models Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T20:50:03.947151Z"},"links":{"cited_paper":"/paper/2506.03065","citing_paper":"/paper/2608.03335"},"observation_digest":"sha256:60d069ec8afa89ede4a15cd84f6ce910f172f228954acabd381172be99762167","observation_id":"5468d60f-563f-43f9-a3f7-aeeccec62463","resolution":{"observed_at":"2026-08-05T20:50:03.947151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03065/citation-record","integrity":"/paper/2506.03065/integrity","json":"/paper/2506.03065/citation-record.json","paper":"/paper/2506.03065"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T11:15:14.392823Z","title":"Longformer: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:14.392823Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:15f356bb76a74e2993db491ec444dff0f644c7f9512a50276ff627467471e49e","observation_id":"afe33d08-fe92-432b-ae1a-471921e8a8b4","resolution":{"observed_at":"2026-08-07T11:15:14.392823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T11:15:14.494535Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:14.494535Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:b640bbb1036dc8b5ebaec0302e765388063f3b3a6056bfafc61295378a34865b","observation_id":"11ee65f5-0dba-4961-9e6f-9d909588bd2a","resolution":{"observed_at":"2026-08-07T11:15:14.494535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:14.604960Z","title":"Ld-pruner: Ef- ficient pruning of latent diffusion models using task-agnostic insights","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:14.604960Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:0330e473bd656de1a3609e2d054a2aab036d01f2e58af67cbb3957bed219757d","observation_id":"4292088d-975d-4d55-9069-e1445ce8c2d5","resolution":{"observed_at":"2026-08-07T11:15:14.604960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01125","last_updated":"2024-06-03T09:10:44Z","snapshot_observed_at":"2026-07-06T18:24:17.711867Z","submitted_at":"2024-06-03T09:10:44Z","title":"$\\Delta$-DiT: A Training-Free Acceleration Method Tailored for Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01125","snapshot_observed_at":"2026-08-07T11:15:14.714375Z","title":"Delta-dit: A training-free acceleration method tailored for diffusion transformers.arXiv preprint arXiv:2406.01125, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:14.714375Z"},"links":{"cited_paper":"/paper/2406.01125","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:e58cda616946576d637c5c565e31f1c0c0e6ab9652f1a8d33b1a15df6caf6bbc","observation_id":"2827ffec-b6e0-424d-9e2f-d85e9e39bd39","resolution":{"observed_at":"2026-08-07T11:15:14.714375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T05:01:32.757930Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-07T11:15:14.783778Z","title":"Generating long sequences with sparse transformers.arXiv preprint arXiv:1904.10509, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:14.783778Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:d91df1ab24c7db78bf7f93ada11b2b8275acc2477d914363a99ed00f998b2798","observation_id":"fb21d783-e0b0-42f4-bf03-c471abc5243d","resolution":{"observed_at":"2026-08-07T11:15:14.783778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-08T23:56:20.438819Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06155","snapshot_observed_at":"2026-08-07T11:15:14.861189Z","title":"Efficient-vdit: Efficient video diffusion transformers with attention tile.arXiv preprint arXiv:2502.06155, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:14.861189Z"},"links":{"cited_paper":"/paper/2502.06155","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:42626f5c32b19ff47d37ad1444832c84b447c14650261e8220fc8749d6e25b56","observation_id":"008a59f2-17ab-48b3-91c7-ab475280a28d","resolution":{"observed_at":"2026-08-07T11:15:14.861189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-07T11:15:14.919834Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis, 2024.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:14.919834Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:1d61f4704547b052d69f0f6f89c3e9291629785566411514197a612a6fe15254","observation_id":"80444ff7-37e0-495c-8dc2-99dce13b4358","resolution":{"observed_at":"2026-08-07T11:15:14.919834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:19.993034Z","title":"Structural pruning for diffusion models","venue":null,"work_id":"1e894d0f-308c-460f-8b68-ecb9849bfcd8","year":2023},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:15.053622Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:743502655f99e9102bd7d2004f1144820d80ad995b3e1b85b05f1e2aec87600b","observation_id":"57ae08fa-4ebf-4722-935b-c2d05eb92350","resolution":{"observed_at":"2026-08-07T11:15:20.118445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:15.131954Z","title":"Neighborhood attention transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:15.131954Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:c171302231a32f84651062c93a1c37c83dfcd37526e70f8b870aca01e8b48062","observation_id":"816893ad-16f6-4cfb-9959-e4b0df2676f7","resolution":{"observed_at":"2026-08-07T11:15:15.131954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07825","last_updated":"2025-02-10T14:49:09Z","snapshot_observed_at":"2026-08-09T01:46:25.522034Z","submitted_at":"2025-02-10T14:49:09Z","title":"Pre-Trained Video Generative Models as World Simulators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07825","snapshot_observed_at":"2026-08-07T11:15:15.192689Z","title":"Pre-trained video generative models as world simulators.arXiv preprint arXiv:2502.07825, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:15.192689Z"},"links":{"cited_paper":"/paper/2502.07825","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:b1dfe3585e0bf24f38e7c2d5484b3fb4e2b9c63e9283be1446df83f91347e1b5","observation_id":"2ec664b1-d70f-464c-b996-844981a4de2a","resolution":{"observed_at":"2026-08-07T11:15:15.192689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06940","last_updated":"2023-07-13T17:57:13Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:57:13Z","title":"Animate-A-Story: Storytelling with Retrieval-Augmented Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06940","snapshot_observed_at":"2026-08-07T11:15:15.291377Z","title":"Animate-a-story: Storytelling with retrieval-augmented video generation.arXiv preprint arXiv:2307.06940, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:15.291377Z"},"links":{"cited_paper":"/paper/2307.06940","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:0209fc10f3596639ac32543ab83127bd258694c66e246b85acbd968183b498d0","observation_id":"fa396819-df35-4c58-9cf3-c4ebd7ea91d6","resolution":{"observed_at":"2026-08-07T11:15:15.291377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:19.886995Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":"34562177-8ba3-48bb-a916-a7dc8789cfa7","year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:15.393406Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:50df67e46db34547bec2ef66cdf721481d3d69e3a8d77caa2a59bcbb6e48073a","observation_id":"5d05a333-f744-4c2a-b9d0-f5d926f63550","resolution":{"observed_at":"2026-08-07T11:15:19.977505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:15.493451Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:15.493451Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:ef071f052df2d966d4c9660dcbbfe71ba3d4d00b936500f9cde1565bb34b99b9","observation_id":"01a894a9-e7c8-42f0-a2dc-423e4c1a28aa","resolution":{"observed_at":"2026-08-07T11:15:15.493451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:15.586946Z","title":"Minference 1.0: Accelerating pre-filling for long-context llms via dynamic sparse attention.Advances in Neural Information Processing Systems, 37:52481–52515, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:15.586946Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:e1751feef3c1acf50ceb99e580af8295586a949bf760f69acc25cd93b6dd7aa6","observation_id":"3a30a21f-b308-4d8a-a49f-d2c786c475e7","resolution":{"observed_at":"2026-08-07T11:15:15.586946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02397","last_updated":"2024-11-07T17:06:32Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T18:59:44Z","title":"Adaptive Caching for Faster Video Generation with Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02397","snapshot_observed_at":"2026-08-07T11:15:15.704247Z","title":"Adaptive caching for faster video generation with diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:15.704247Z"},"links":{"cited_paper":"/paper/2411.02397","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:cd14a2b0129177fdf18ffba73961f29e546326a43c0ec18037a79abe9ef69f41","observation_id":"82fa8275-d35d-4172-8333-c53ecb4f40be","resolution":{"observed_at":"2026-08-07T11:15:15.704247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T11:15:15.801169Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:15.801169Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:42a95120bdec725c4f64c8f21154dd0852f666e4ef58426c46ab613ae3b8f14a","observation_id":"31a7549c-480a-45fa-9364-fa2da046fab1","resolution":{"observed_at":"2026-08-07T11:15:15.801169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-07T11:15:15.864790Z","title":"Flexprefill: A context- aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:15.864790Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:36ffa31e138c7ccc78aa7230c7d6ff963739177cffe2a74ab149fc5eb14505d6","observation_id":"5bfbc421-98c1-467d-a47e-8c7bdcfe314a","resolution":{"observed_at":"2026-08-07T11:15:15.864790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-07T11:15:15.930372Z","title":"Open-sora plan: Open-source large video generation model.arXiv preprint arXiv:2412.00131, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:15.930372Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:0878f7d9db6510779223dbbf6a869c04233cc98abaa59ee8125a368a85e7a8af","observation_id":"9328eb4b-3f0a-4c56-bef5-d61349337019","resolution":{"observed_at":"2026-08-07T11:15:15.930372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:16.001509Z","title":"Diffusion adversarial post-training for one-step video generation.arXiv preprint arXiv:2501.08316, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:16.001509Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:ea7e340366bfdb0067f6086edfdeb0a42e8f807c194b94bd5851e8977309b773","observation_id":"55920021-a95f-42b0-80e6-661be7bc7920","resolution":{"observed_at":"2026-08-07T11:15:16.001509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19108","last_updated":"2025-03-18T04:49:23Z","snapshot_observed_at":"2026-07-06T19:58:31.184255Z","submitted_at":"2024-11-28T12:50:05Z","title":"Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19108","snapshot_observed_at":"2026-08-07T11:15:16.056909Z","title":"Timestep embedding tells: It’s time to cache for video diffusion model.arXiv preprint arXiv:2411.19108, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:16.056909Z"},"links":{"cited_paper":"/paper/2411.19108","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:dba386edf2d1959c44947492f00b4f6e6c15ee18980ef138b952583223d3598f","observation_id":"ecff04f6-bdca-4c98-b052-00923f6c1cef","resolution":{"observed_at":"2026-08-07T11:15:16.056909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16112","last_updated":"2024-12-20T17:57:09Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T17:57:09Z","title":"CLEAR: Conv-Like Linearization Revs Pre-Trained Diffusion Transformers Up","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16112","snapshot_observed_at":"2026-08-07T11:15:16.170658Z","title":"Clear: Conv-like linearization revs pre-trained diffusion transformers up.arXiv preprint arXiv:2412.16112, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:16.170658Z"},"links":{"cited_paper":"/paper/2412.16112","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:8f2f180675fcb45e7331ab7b558deb262f416b5d7b9a1aee42bd7a4df8b6e53e","observation_id":"819697d8-6b6f-453f-afef-8326d1911db9","resolution":{"observed_at":"2026-08-07T11:15:16.170658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:16.222163Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:16.222163Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:d271adfc9767a5dd813992d7f267cb620fef0fe03947050fc73cfe3b4b632b8c","observation_id":"4619a122-399c-4073-8e37-cd9583cd1fac","resolution":{"observed_at":"2026-08-07T11:15:16.222163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19355","last_updated":"2025-03-12T03:40:38Z","snapshot_observed_at":"2026-08-05T05:01:08.560635Z","submitted_at":"2024-10-25T07:24:38Z","title":"FasterCache: Training-Free Video Diffusion Model Acceleration with High Quality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19355","snapshot_observed_at":"2026-08-07T11:15:16.311954Z","title":"Fastercache: Training-free video diffusion model acceleration with high quality.arXiv preprint arXiv:2410.19355, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:16.311954Z"},"links":{"cited_paper":"/paper/2410.19355","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:0f8131c5bce0591fb7116b6b3760788fc77f4bed4853a297edf118cdcd3c48be","observation_id":"8b0d94a6-e522-45d3-b7c0-b8109eec9798","resolution":{"observed_at":"2026-08-07T11:15:16.311954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:16.389068Z","title":"Deepcache: Accelerating diffusion models for free","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:16.389068Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:cdd87ade5adec78ec2914c9493d4d85ee254e2efbe0729bc1f4edad8211ec6b9","observation_id":"ce59189e-b970-4f39-a222-fb9665cb49f9","resolution":{"observed_at":"2026-08-07T11:15:16.389068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-08-08T09:48:34.424815Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05363","snapshot_observed_at":"2026-08-07T11:15:16.497799Z","title":"Towards world simulator: Crafting physical commonsense- based benchmark for video generation.arXiv preprint arXiv:2410.05363, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:16.497799Z"},"links":{"cited_paper":"/paper/2410.05363","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:59c18a8ff32fdf557a67dd5c4179db351000fdd881fd0fe679a81d342b780d12","observation_id":"ec6d1b80-03d1-47a5-919d-6c805ff1082f","resolution":{"observed_at":"2026-08-07T11:15:16.497799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:16.586188Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:16.586188Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:1c2d7519b4060a1efc7ba828fb40c113204f20a4ca5e7b2c093c36558d82d687","observation_id":"357eba18-fac0-4ec5-8fb1-aff71f81e27e","resolution":{"observed_at":"2026-08-07T11:15:16.586188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:16.680560Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:16.680560Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:828d048803c6de97344d5cd3d9a849926463a09996cad1da54ce348a6c9582ff","observation_id":"a617c6d5-21a8-4ede-bfda-125ba76e3be3","resolution":{"observed_at":"2026-08-07T11:15:16.680560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:19.728192Z","title":"Post-training quantization on diffusion models","venue":null,"work_id":"e8716282-8c78-4694-98cb-5256339fab4e","year":1972},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:16.734593Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:47842b6ca79bc28aae6d81b037719416f9fb74918822792110310c0264cd1bc9","observation_id":"4d3c533e-c998-4540-ac8f-a6575e1435fc","resolution":{"observed_at":"2026-08-07T11:15:19.773754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:19.582734Z","title":"MD-dit: Step-aware mixture-of-depths for efficient diffusion transformers","venue":null,"work_id":"1ff77442-4108-42cd-af15-8037e42feaf6","year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:16.828763Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:d8e44a306a03579f643e65b2d97c52b2602e3005bc0a9e410e676768ff95b3d0","observation_id":"66961187-1e0a-4f09-9bc2-81c586e7b42e","resolution":{"observed_at":"2026-08-07T11:15:19.657568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13552","last_updated":"2025-08-12T05:44:45Z","snapshot_observed_at":"2026-07-06T19:53:21.444233Z","submitted_at":"2024-11-20T18:59:52Z","title":"REDUCIO! Generating 1K Video within 16 Seconds using Extremely Compressed Motion Latents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13552","snapshot_observed_at":"2026-08-07T11:15:16.889183Z","title":"Reducio! generating 1024 times1024 video within 16 seconds using extremely compressed motion latents.arXiv preprint arXiv:2411.13552, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:16.889183Z"},"links":{"cited_paper":"/paper/2411.13552","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:38d5bd8b4c8b0a79d699b2596d071c3012783271d1458a7e65031f93636191cd","observation_id":"a1d97e77-f827-405d-92dd-6aaf73342a61","resolution":{"observed_at":"2026-08-07T11:15:16.889183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:16.969476Z","title":"Triton: an intermediate language and compiler for tiled neural network computations","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:16.969476Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:4fcf126e72b8b345ec722aa4b68c35dd932300c4f504fe1c415773a7b033c6dc","observation_id":"65cb2c5f-47ee-4a1e-954e-87c25a2dba23","resolution":{"observed_at":"2026-08-07T11:15:16.969476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T11:15:17.100784Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:17.100784Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:16519d0ebe75cc62b2e0e78cd1ffd99a7f4b78d6a9b5d5df40433569bfe63efe","observation_id":"0b95db35-90b3-4bd5-8322-65f8cd92703d","resolution":{"observed_at":"2026-08-07T11:15:17.100784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:17.174838Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:17.174838Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:fd6509ab7bf1b1ba1d11514adf6205a4a0432f2031c29c9554eb56ccfa9e510b","observation_id":"b5f83350-da94-45a8-ae81-389529d36905","resolution":{"observed_at":"2026-08-07T11:15:17.174838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T11:15:17.312148Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:17.312148Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:048e752cabc2e23f9fedd038b4807552aa8b90e6b1270eba625fba62f6a63976","observation_id":"9508745a-2707-407d-bf3c-c7cb80e309aa","resolution":{"observed_at":"2026-08-07T11:15:17.312148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04746","last_updated":"2025-06-13T02:29:47Z","snapshot_observed_at":"2026-08-07T03:44:44.446465Z","submitted_at":"2024-11-07T14:29:02Z","title":"Taming Rectified Flow for Inversion and Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04746","snapshot_observed_at":"2026-08-07T11:15:17.421351Z","title":"Taming rectified flow for inversion and editing.arXiv preprint arXiv:2411.04746, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:17.421351Z"},"links":{"cited_paper":"/paper/2411.04746","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:3977b436e134bd59010515b9f2a828c390c4135d420eb5d16c77be3ac05dac0d","observation_id":"01a36b3c-7a2b-4268-b0cd-e644168d0c1a","resolution":{"observed_at":"2026-08-07T11:15:17.421351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:19.377882Z","title":"A universal image quality index.IEEE signal processing letters, 9(3):81–84, 2002","venue":null,"work_id":"a90f4847-4c9a-4203-b5e2-374c48432369","year":2002},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:17.526500Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:b82dd05c26d915175e089beae7132f365427be55c936422f2594ea43c6dc0d52","observation_id":"f901e63f-848b-410c-aa41-fcdc43698073","resolution":{"observed_at":"2026-08-07T11:15:19.454645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16005","last_updated":"2024-10-17T15:28:15Z","snapshot_observed_at":"2026-08-08T18:38:43.925941Z","submitted_at":"2024-05-25T02:02:08Z","title":"PTQ4DiT: Post-training Quantization for Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16005","snapshot_observed_at":"2026-08-07T11:15:17.600341Z","title":"Ptq4dit: Post-training quantization for diffusion transformers.arXiv preprint arXiv:2405.16005, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:17.600341Z"},"links":{"cited_paper":"/paper/2405.16005","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:a2d2ecf37bca9469021231fedee1bbfe7c46223854598a9e3eb46f27b11ece3d","observation_id":"48ef1737-aea0-4d16-8b0f-7eff42736ed0","resolution":{"observed_at":"2026-08-07T11:15:17.600341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01776","last_updated":"2025-04-27T00:10:11Z","snapshot_observed_at":"2026-08-09T14:28:28.006632Z","submitted_at":"2025-02-03T19:29:16Z","title":"Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01776","snapshot_observed_at":"2026-08-07T11:15:17.692975Z","title":"Sparse videogen: Accelerating video diffusion transformers with spatial-temporal sparsity.arXiv preprint arXiv:2502.01776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:17.692975Z"},"links":{"cited_paper":"/paper/2502.01776","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:b9e288383f5d4613a434b654125f6aec8670f7470ada0cbe5cf3b977fdd00038","observation_id":"e7e096eb-6989-47c4-b97d-ae330f0af6cf","resolution":{"observed_at":"2026-08-07T11:15:17.692975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-08-07T11:15:17.818811Z","title":"Duoattention: Efficient long-context llm inference with retrieval and streaming heads.arXiv preprint arXiv:2410.10819, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:17.818811Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:8924fae6dd131a667f7171a8b26c06a3560d55b175427a9da6ebfcb1c5dba2ae","observation_id":"0a2310c5-0489-47ab-9507-9fb286ca6155","resolution":{"observed_at":"2026-08-07T11:15:17.818811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T11:15:17.899959Z","title":"Efficient streaming language models with attention sinks.arXiv preprint arXiv:2309.17453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:17.899959Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:fedea1546f215c8b0b9ea10d669845fd3d4490730b407a38476d8f3e73731f40","observation_id":"89422a6f-e3c9-4110-8a11-52789c4060a8","resolution":{"observed_at":"2026-08-07T11:15:17.899959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-07T11:15:17.947369Z","title":"Sana: Efficient high-resolution image synthesis with linear diffusion transformers.arXiv preprint arXiv:2410.10629, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:17.947369Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:567d356ec5de125d240e63029c4f86867ce9f16ab05d9d769fdcfc0a6fce67ce","observation_id":"61c2594e-de15-4db9-9916-604867f466f5","resolution":{"observed_at":"2026-08-07T11:15:17.947369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:18.000721Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:18.000721Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:9d7bc401d67934e647096cbd1a55e3c6a39dbdd3fcce4489ae837dadedfdf733","observation_id":"d8ee225c-35fb-4915-afcb-57e13eb2f44d","resolution":{"observed_at":"2026-08-07T11:15:18.000721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T11:15:18.074114Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:18.074114Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:2d51562efe30f68425bd838ce12bbb35b85103b809435d505ffa6fa0ddd482b4","observation_id":"b69334d9-a790-4463-ab78-c6d493652f41","resolution":{"observed_at":"2026-08-07T11:15:18.074114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:19.234095Z","title":"Ditfastattn: Attention compression for diffusion transformer models.Advances in Neural Information Processing Systems, 37:1196–1219, 2024","venue":null,"work_id":"bbbff2d0-2b66-4a2d-9752-634e8d386ed0","year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:18.137279Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:95fcc03146766f1ad62633123fa51498da177cf396fc53ff544e9a35539eb85e","observation_id":"6d5b2940-0fed-4dcc-b58a-aab97b4b341c","resolution":{"observed_at":"2026-08-07T11:15:19.301120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:19.103905Z","title":"Motion consistency model: Accelerating video diffusion with disentangled motion-appearance distillation.Advances in Neural Information Processing Systems, 37:111000–111021, 2024","venue":null,"work_id":"9deac95f-82ba-469c-b5a5-f9a0ad0c0b8e","year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:18.198285Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:ae901c3a3645be1c102a62e2a2780049dc33e72cbbc0c95da3f89c2f44bbe111","observation_id":"638d182d-b4c7-476b-88c6-873c9e37be02","resolution":{"observed_at":"2026-08-07T11:15:19.171343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17641","last_updated":"2025-03-22T04:12:20Z","snapshot_observed_at":"2026-08-07T16:44:36.750320Z","submitted_at":"2025-03-22T04:12:20Z","title":"InstructVEdit: A Holistic Approach for Instructional Video Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17641","snapshot_observed_at":"2026-08-07T11:15:18.258170Z","title":"Instructvedit: A holistic approach for instructional video editing.arXiv preprint arXiv:2503.17641, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:18.258170Z"},"links":{"cited_paper":"/paper/2503.17641","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:9a6595f87d38942e8a43cd0b90fc09a6dd9739d8fd4e2e7fc7433cd446bb110a","observation_id":"5daa6921-079d-4f24-943a-1ee2dcc981b3","resolution":{"observed_at":"2026-08-07T11:15:18.258170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22796","last_updated":"2025-03-28T18:00:12Z","snapshot_observed_at":"2026-08-07T16:29:25.217332Z","submitted_at":"2025-03-28T18:00:12Z","title":"DiTFastAttnV2: Head-wise Attention Compression for Multi-Modality Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22796","snapshot_observed_at":"2026-08-07T11:15:18.309915Z","title":"Ditfastattnv2: Head-wise attention compression for multi- modality diffusion transformers.arXiv preprint arXiv:2503.22796, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:18.309915Z"},"links":{"cited_paper":"/paper/2503.22796","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:edbf481ed7cb781b5001e78fc51261c0e11288262db604489a4c435802387c83","observation_id":"55d919ff-f73d-4561-87b5-7e1836b9f89d","resolution":{"observed_at":"2026-08-07T11:15:18.309915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:18.375024Z","title":"The unrea- sonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:18.375024Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:bdbf441ca38955ca647efd4e080e6828dfb89120f62d1a5da82856a4096d2009","observation_id":"7c4bc236-ea8a-4fbf-8cc6-e223d5ca6900","resolution":{"observed_at":"2026-08-07T11:15:18.375024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:18.970439Z","title":"Pioneering 4-bit fp quantization for diffusion models: Mixup-sign quantization and timestep-aware fine-tuning, 2025","venue":null,"work_id":"ff17cecd-b330-4af3-9e35-386229a46926","year":2025},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:18.430630Z"},"links":{"citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:48e4f3fa61875e750790a40c9b8d5881f5ac810a157253ef6786a5b043321c29","observation_id":"9e98e2f2-69ff-4ace-a17c-31c298d5ede7","resolution":{"observed_at":"2026-08-07T11:15:19.024778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12588","last_updated":"2025-02-27T07:00:30Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T17:54:21Z","title":"Real-Time Video Generation with Pyramid Attention Broadcast","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12588","snapshot_observed_at":"2026-08-07T11:15:18.510621Z","title":"Real-time video generation with pyramid attention broadcast.arXiv preprint arXiv:2408.12588, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:18.510621Z"},"links":{"cited_paper":"/paper/2408.12588","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:4883d95da264c2e41b561dca07798bbfa87cece844cf0fc01f5771556f3e41f4","observation_id":"7785b33f-34ad-4b07-b343-b05afabecfbd","resolution":{"observed_at":"2026-08-07T11:15:18.510621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18428","last_updated":"2024-11-26T16:42:34Z","snapshot_observed_at":"2026-07-06T18:21:30.595036Z","submitted_at":"2024-05-28T17:59:33Z","title":"DiG: Scalable and Efficient Diffusion Models with Gated Linear Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18428","snapshot_observed_at":"2026-08-07T11:15:18.581949Z","title":"Dig: Scalable and efficient diffusion models with gated linear attention.arXiv preprint arXiv:2405.18428, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:18.581949Z"},"links":{"cited_paper":"/paper/2405.18428","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:8334d7c9878e26235921f843d70dfdee9f20767871a48654340159a53b3c602a","observation_id":"6d3c4f4e-e987-4af4-a5db-a2c5a4471d8f","resolution":{"observed_at":"2026-08-07T11:15:18.581949Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 11 inbound Pith citation observations for arXiv:2506.03065."}