{"as_of":"2026-08-10T14:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c4533337211bca8a71bb1b1d3f84f5ff7ef32b345da74920dcb2032f1d6e92cb","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T15:35:17.596078Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2512.16615/citation-record","integrity":"/paper/2512.16615/integrity","json":"/paper/2512.16615/citation-record.json","paper":"/paper/2512.16615"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03065","snapshot_observed_at":"2026-08-03T15:35:13.213540Z","title":"Sparse-vdit: Unleashing the power of sparse attention to accelerate video diffusion transformers.arXiv preprint arXiv:2506.03065, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:13.213540Z"},"links":{"cited_paper":"/paper/2506.03065","citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:ada708d7575d1620b609043ed2e585d104c55c7693207c45f9758e918366d715","observation_id":"67a6f03d-8ad4-450c-a056-0638d32f6739","resolution":{"observed_at":"2026-08-03T15:35:13.213540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07963","last_updated":"2025-04-10T17:59:56Z","snapshot_observed_at":"2026-08-10T13:40:29.599895Z","submitted_at":"2025-04-10T17:59:56Z","title":"PixelFlow: Pixel-Space Generative Models with Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07963","snapshot_observed_at":"2026-08-03T15:35:13.368010Z","title":"Pixelflow: Pixel-space generative models with flow.arXiv preprint arXiv:2504.07963, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:13.368010Z"},"links":{"cited_paper":"/paper/2504.07963","citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:dab5119cf85eb3087648daba0776e49a09dc6bafaa9e3a27aaa7e98b06f6f86d","observation_id":"5c217c85-25fb-41a1-a626-ff52e4422d43","resolution":{"observed_at":"2026-08-03T15:35:13.368010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10972","last_updated":"2023-05-21T07:07:55Z","snapshot_observed_at":"2026-08-08T02:32:31.177380Z","submitted_at":"2023-01-26T07:37:22Z","title":"On the Importance of Noise Scheduling for Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.10972","snapshot_observed_at":"2026-08-03T15:35:13.540081Z","title":"On the importance of noise scheduling for diffu- sion models.arXiv preprint arXiv:2301.10972, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:13.540081Z"},"links":{"cited_paper":"/paper/2301.10972","citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:926df0ed27f6e8e4e3c4e378195e7f01e31798db87d0a05455165d040f733f7b","observation_id":"d7031c64-1827-49c9-97a3-7a4a7fb8921e","resolution":{"observed_at":"2026-08-03T15:35:13.540081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:13.653021Z","title":"Scalable high-resolution pixel-space image syn- thesis with hourglass diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:13.653021Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:e6473e52d2d832f5bd087ac33d42a04d90592f2c794730c80ce453faa174e3c6","observation_id":"8fd7768e-925c-44e9-93a3-a84b59a1b181","resolution":{"observed_at":"2026-08-03T15:35:13.653021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:13.809650Z","title":"FlashAttention-2: Faster attention with better par- allelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:13.809650Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:f36dd9e737028b420445e1da6fcf7450328d8924a00a012ae1cce58dcdefda26","observation_id":"0d715900-2980-43f3-9959-899de6adbaef","resolution":{"observed_at":"2026-08-03T15:35:13.809650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:13.940097Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness.Advances in neural information processing systems, 35:16344–16359, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:13.940097Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:853b5264ed00c8266fb8ae25aadab1719092b5e611bc2f1f9807272cc2576927","observation_id":"70490a8b-271d-4fa7-a109-4eb20bb9c319","resolution":{"observed_at":"2026-08-03T15:35:13.940097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:14.085627Z","title":"Scaling vision transformers to 22 billion pa- rameters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:14.085627Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:cd1dab4a88245e3b20ad3d9420d4f548d2548545b3f70077eb800642fa945aee","observation_id":"8f62f618-a650-40cf-ad9e-e30b5d61dfb7","resolution":{"observed_at":"2026-08-03T15:35:14.085627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:14.191205Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:14.191205Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:516ef6daee9d0c7f9927ea8d3891eabd1f898cdee66ce59728a242e67d8e3753","observation_id":"335ee7a3-0baa-4d9f-8517-6c0ef167ad64","resolution":{"observed_at":"2026-08-03T15:35:14.191205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:14.299211Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:14.299211Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:c71e66763e5d75464665e8d8f6368ba5299f72330f11b88eca05fd4e56ae6c74","observation_id":"2474dff8-fb2b-4a03-9acf-3b0cb01ad7fc","resolution":{"observed_at":"2026-08-03T15:35:14.299211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:14.381463Z","title":"Log-linear attention.arXiv preprint arXiv:2506.04761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:14.381463Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:16c91f141b6928071f6279af34ad146a96ff941b2e680c347a5f2ba9bb9bdbdc","observation_id":"000c4cf3-3be2-46c5-aea4-c68bba4c22e8","resolution":{"observed_at":"2026-08-03T15:35:14.381463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:14.447712Z","title":"Two fast algorithms for sparse matri- ces: Multiplication and permuted transposition.ACM Trans- actions on Mathematical Software (TOMS), 4(3):250–269,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:14.447712Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:b17388076432927827870c3b8e977cdfdebc2826e168d392dbdbe83e8b033342","observation_id":"b28721a1-a70c-49be-8199-a1736b3abcff","resolution":{"observed_at":"2026-08-03T15:35:14.447712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:14.538916Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:14.538916Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:09440995db8f0a1e5a48b05926d31c67a3a7da1ed81bf473820987fad3e2095a","observation_id":"f45b1042-0927-47b3-b087-6e3f81b5e2b3","resolution":{"observed_at":"2026-08-03T15:35:14.538916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:14.620080Z","title":"sim- ple diffusion: End-to-end diffusion for high resolution im- ages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:14.620080Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:04d888117c373dd5ca38e7a9ba8298d31712921c9cbe2c3a886d473dbe846847","observation_id":"87f02fc8-e78e-4ac5-9b55-1a524a36b879","resolution":{"observed_at":"2026-08-03T15:35:14.620080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:14.718651Z","title":"Minference 1.0: Accel- erating pre-filling for long-context llms via dynamic sparse attention.Advances in Neural Information Processing Sys- tems, 37:52481–52515, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:14.718651Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:da5f3074c8fc4d2cab93905b80e15142052a9c9d01d4898510fd3999e4cbe055","observation_id":"9affbbef-ecf8-41d0-a477-0e26e366953c","resolution":{"observed_at":"2026-08-03T15:35:14.718651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:14.839017Z","title":"Fast mul- tipole attention: A divide-and-conquer attention mechanism for long sequences.arXiv preprint arXiv:2310.11960, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:14.839017Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:596f5bf10874bb0dd9dd536e3b9d783c893d5a5f8e118bbad93d2f58b7ebcf70","observation_id":"d7b3369c-9950-46f7-8e6d-8b3269b475c7","resolution":{"observed_at":"2026-08-03T15:35:14.839017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:14.997239Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:14.997239Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:4e324e0f5afe734d6591c5b0f137effb0c18de3c3604c4746108634e570b8d50","observation_id":"ae2aa1bf-6511-467a-9f75-b3024ce4633f","resolution":{"observed_at":"2026-08-03T15:35:14.997239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-03T15:35:15.125441Z","title":"Reformer: The efficient transformer.arXiv preprint arXiv:2001.04451, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:15.125441Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:7f51ce8db678ed27f4b43afce2a86b853df615449426a6fa72efbf855dab859a","observation_id":"a12aa9b4-e674-405f-b4e7-b98ea22ddcd9","resolution":{"observed_at":"2026-08-03T15:35:15.125441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:15.202397Z","title":"Flux.https://github.com/ black-forest-labs/flux, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:15.202397Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:7f74b2e91286ef874819cc58ef9dc6c5a0ff913c00ed6c00346ab8f14de0230e","observation_id":"fbcd84db-289e-4cb0-89a8-1a026b335335","resolution":{"observed_at":"2026-08-03T15:35:15.202397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:15.224825Z","title":"Radial attention: O (nlog n) sparse at- tention with energy decay for long video generation.arXiv preprint arXiv:2506.19852, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:15.224825Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:6ce0a097e8d6bccdf77c4b793d2526f8a3d7efd37ef1c4f63c59ecc39020ddc1","observation_id":"81202b2c-1ae7-4f0b-a702-3c378829a48e","resolution":{"observed_at":"2026-08-03T15:35:15.224825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-03T15:35:15.339991Z","title":"Flow matching for generative mod- eling.arXiv preprint arXiv:2210.02747, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:15.339991Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:d8b711a09df7f25863809b65c089abeb158916816077c20848edc12debab2d17","observation_id":"713ac270-da36-4af1-bfe3-1fbe0720a430","resolution":{"observed_at":"2026-08-03T15:35:15.339991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-03T15:35:15.447360Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow.arXiv preprint arXiv:2209.03003, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:15.447360Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:bd67f9bbc2841025712f3998ae1e029caa107622c530fd2ea7bbdb236f23a2ad","observation_id":"e7500125-8856-46fe-8513-69c861dde2d5","resolution":{"observed_at":"2026-08-03T15:35:15.447360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-03T15:35:15.553731Z","title":"Moba: Mixture of block attention for long- context llms.arXiv preprint arXiv:2502.13189, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:15.553731Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:d38407fc928f91f32d99584d42416d4f7a0c71a326aa83c77263fbcacf0a5759","observation_id":"9f28409e-6f4e-4de5-a9df-3a649259673c","resolution":{"observed_at":"2026-08-03T15:35:15.553731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08740","last_updated":"2024-09-23T15:59:41Z","snapshot_observed_at":"2026-08-07T23:50:09.060564Z","submitted_at":"2024-01-16T18:55:25Z","title":"SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08740","snapshot_observed_at":"2026-08-03T15:35:15.656310Z","title":"Sit: Explor- ing flow and diffusion-based generative models with scalable interpolant transformers.arXiv preprint arXiv:2401.08740,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:15.656310Z"},"links":{"cited_paper":"/paper/2401.08740","citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:ba4e9a4d116d8405e4fbd7b7d7adcbe13c862b32ae0322cacaef60e80d3a6052","observation_id":"775d61ef-fa8c-40ee-8185-c4fffa423b47","resolution":{"observed_at":"2026-08-03T15:35:15.656310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:15.763826Z","title":"Merge-based parallel sparse matrix-vector multiplication","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:15.763826Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:364f4c486811fac16c1dcf2067bcaca542804abdca17bc31970ef683472a61a8","observation_id":"9e5d6264-4f8e-4682-b607-e1f9d25a0775","resolution":{"observed_at":"2026-08-03T15:35:15.763826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:15.874043Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:15.874043Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:1bead91302b6f18932bf4f346312ff18be8fbbd1df43dec7072df90d6c025d60","observation_id":"fdcbddda-8fdd-4122-b67e-de621c4d1bd2","resolution":{"observed_at":"2026-08-03T15:35:15.874043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:15.979132Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:15.979132Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:351a22494642c150d2a39530a3d18040aa426df12d95cf86eb659fc9bc30caf5","observation_id":"e45a4436-525a-4b80-978d-d5f563fd9044","resolution":{"observed_at":"2026-08-03T15:35:15.979132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:16.041357Z","title":"Improved techniques for training gans.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:16.041357Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:3a41bad7cc38aaf4820003d618c988971cc128af846858fc70ef1d021ba64b6f","observation_id":"74c6f5d1-e03c-46b0-902d-84db6dd6eeb9","resolution":{"observed_at":"2026-08-03T15:35:16.041357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:16.143178Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:16.143178Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:e5b8d2b2a12d792b97acc700d1af464a58deed00e9171ed551f5774dd5f0a075","observation_id":"f27e67b0-95f3-43ef-b4a9-ab9a61620e28","resolution":{"observed_at":"2026-08-03T15:35:16.143178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:16.260490Z","title":"Tri- ton: an intermediate language and compiler for tiled neu- ral network computations","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:16.260490Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:cd43a6578bc5029ed0efa91f33ea3cb82598aeab6d9f3e1e763cb1207f788790","observation_id":"f88dab63-130e-4143-aabf-5380e6b97bf4","resolution":{"observed_at":"2026-08-03T15:35:16.260490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:16.346084Z","title":"Attention is all you need.Advances in Neural Information Processing Systems, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:16.346084Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:e2ba1b4a650e5871c19aedcfb41fe36c56009de8957f0aacf10f334d9dfe385e","observation_id":"664399a5-5103-4d77-aad3-ea635ea26ced","resolution":{"observed_at":"2026-08-03T15:35:16.346084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-03T15:35:16.439344Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:16.439344Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:beb8e57a317e38aa4b448a9960e9f7b8e83e07320a276ff5a334bef9ae67e7b8","observation_id":"2396d55c-21f8-47ca-a969-fb5d57cafae9","resolution":{"observed_at":"2026-08-03T15:35:16.439344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:16.538198Z","title":"Pixnerd: Pixel neural field diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:16.538198Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:cb935e9ec8ca02e9b9b7b449d5785c0829eccfc87cbbac594f496e4753b9467e","observation_id":"3017fb52-3e51-4049-b692-27ebbccb4ef8","resolution":{"observed_at":"2026-08-03T15:35:16.538198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23858","last_updated":"2025-06-30T13:52:31Z","snapshot_observed_at":"2026-08-08T15:17:52.819952Z","submitted_at":"2025-06-30T13:52:31Z","title":"VMoBA: Mixture-of-Block Attention for Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23858","snapshot_observed_at":"2026-08-03T15:35:16.608595Z","title":"Vmoba: Mixture- of-block attention for video diffusion models.arXiv preprint arXiv:2506.23858, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:16.608595Z"},"links":{"cited_paper":"/paper/2506.23858","citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:b12beaa9820f7beb4f4022e38d59e29d5d97d0eb7c6dd5fbf087ce372dac5712","observation_id":"866ffe94-0c5a-40de-8302-36b2bc19ffb7","resolution":{"observed_at":"2026-08-03T15:35:16.608595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01776","last_updated":"2025-04-27T00:10:11Z","snapshot_observed_at":"2026-08-10T06:09:21.088224Z","submitted_at":"2025-02-03T19:29:16Z","title":"Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01776","snapshot_observed_at":"2026-08-03T15:35:16.759708Z","title":"Sparse videogen: Accelerating video diffusion transformers with spatial-temporal sparsity.arXiv preprint arXiv:2502.01776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:16.759708Z"},"links":{"cited_paper":"/paper/2502.01776","citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:40a92e05bec650e6da9715517de9d2a5584b34d9737656baa6341ae76248d7db","observation_id":"c3ebcfb7-2543-4843-82e6-59217e08f0c9","resolution":{"observed_at":"2026-08-03T15:35:16.759708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21079","last_updated":"2025-02-28T14:11:20Z","snapshot_observed_at":"2026-08-07T17:39:41.540184Z","submitted_at":"2025-02-28T14:11:20Z","title":"Training-free and Adaptive Sparse Attention for Efficient Long Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21079","snapshot_observed_at":"2026-08-03T15:35:16.866211Z","title":"Training-free and adaptive sparse attention for efficient long video generation.arXiv preprint arXiv:2502.21079, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:16.866211Z"},"links":{"cited_paper":"/paper/2502.21079","citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:160b0864cacdc9999953213bd8767499f8c549a512931fb2a6e1a13b9b8e07fc","observation_id":"19d1f1a1-960b-4699-b5ba-214226e5b2c0","resolution":{"observed_at":"2026-08-03T15:35:16.866211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18875","last_updated":"2026-05-06T23:08:29Z","snapshot_observed_at":"2026-08-02T05:41:40.015287Z","submitted_at":"2025-05-24T21:30:29Z","title":"Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18875","snapshot_observed_at":"2026-08-03T15:35:16.997670Z","title":"Sparse videogen2: Accelerate video generation with sparse attention via semantic-aware permutation.arXiv preprint arXiv:2505.18875, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:16.997670Z"},"links":{"cited_paper":"/paper/2505.18875","citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:2843e37e457dd59dfd63e23e15b4a8777ecaab467e4d59b2246470c391b457e5","observation_id":"3549f437-ce7f-46d8-b83a-21050beea9c6","resolution":{"observed_at":"2026-08-03T15:35:16.997670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:17.154046Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:17.154046Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:3ab81f4411558f47bcfe5e5cf85d84d9ebe092055f924093bc86fdd0d8ba6a1a","observation_id":"c2edf129-e399-4779-abd9-6bca243cc9af","resolution":{"observed_at":"2026-08-03T15:35:17.154046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:17.285937Z","title":"Multi resolution analysis (mra) for approx- imate self-attention","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:17.285937Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:5598ff6c1abc0cef3100c0cc723b1005a19ad6ace290718f1881addfff251336","observation_id":"31dd32d6-2a34-49fc-bfc3-fe38b1a44393","resolution":{"observed_at":"2026-08-03T15:35:17.285937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:17.418735Z","title":"Spargeattention: Accurate and training-free sparse attention accelerating any model in- ference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:17.418735Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:4dd4e36ac23925fddc6df0b6cd17e7e052d19f6fdb2cfefbd2c4ad2b1b8c617b","observation_id":"2a024c2a-442c-43b9-8f61-89f51d1338b3","resolution":{"observed_at":"2026-08-03T15:35:17.418735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:17.584594Z","title":"Gonzalez, Jun Zhu, and Jianfei Chen","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:17.584594Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:ab5790a1c1a43216abfe811fe41009e4a2340f5fa7f34f38a0c32af72481b94c","observation_id":"d384bb83-583a-4ce1-8c3b-1351f22b83e9","resolution":{"observed_at":"2026-08-03T15:35:17.584594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:17.589675Z","title":"11 Faster video diffusion with trainable sparse attention.arXiv e-prints, pages arXiv–2505, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:17.589675Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:13a0b771372133cc3540ac937123f51c0488498aa7553b1c40a01ae986c003cc","observation_id":"d9682e47-3ae1-4401-ac5e-a4e7b6f4f355","resolution":{"observed_at":"2026-08-03T15:35:17.589675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:35:17.592902Z","title":"Training-free efficient video generation via dynamic token carving.arXiv preprint arXiv:2505.16864, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:17.592902Z"},"links":{"citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:2ba0dd7a7ad083a9415c40635ccb667991fba11056dadb1170d9cbc80c847d93","observation_id":"61bea913-2e47-444b-ac86-ee033d622e8a","resolution":{"observed_at":"2026-08-03T15:35:17.592902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.11906","last_updated":"2021-07-25T23:07:03Z","snapshot_observed_at":"2026-08-05T05:07:45.646026Z","submitted_at":"2021-07-25T23:07:03Z","title":"H-Transformer-1D: Fast One-Dimensional Hierarchical Attention for Sequences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.11906","snapshot_observed_at":"2026-08-03T15:35:17.596078Z","title":"H-transformer-1d: Fast one-dimensional hierarchical attention for sequences.arXiv preprint arXiv:2107.11906, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T15:35:17.596078Z"},"links":{"cited_paper":"/paper/2107.11906","citing_paper":"/paper/2512.16615"},"observation_digest":"sha256:a5f363d8c5bf32ca28e4a68c761b1a30027e4eb81e2d8875d894474907bfb9f9","observation_id":"eb077dba-465d-4737-a4c2-e76532465908","resolution":{"observed_at":"2026-08-03T15:35:17.596078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.16615","last_updated":"2026-07-23T12:12:25Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:52:07.948019Z","submitted_at":"2025-12-18T14:53:12Z","title":"Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2512.16615."}