{"as_of":"2026-08-15T22:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:90d67ae2c0990d4247a18145190d42608075d3e22af072f2f1071ef3554015e0","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:17:12.775410Z","state":"measured"},{"denominator":121,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":121,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":55,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:52:33.405224Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2505.23606","last_updated":"2026-04-13T07:14:16Z","snapshot_observed_at":"2026-08-13T04:58:18.304861Z","submitted_at":"2025-05-29T16:15:48Z","title":"Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T12:59:31.454155Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2505.23606"},"observation_digest":"sha256:a622da51a03c0b8694b4595908b72062da06f906b9382c59e3390796ac9b0a43","observation_id":"7d907a1e-04fc-48a9-8eb6-d0aa13ecf1c9","resolution":{"observed_at":"2026-05-19T13:02:18.398850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-06T22:52:33.405224Z","title":"dkv-cache: The cache for diffusion language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20639","last_updated":"2025-06-26T15:46:40Z","snapshot_observed_at":"2026-08-15T21:31:14.491444Z","submitted_at":"2025-06-25T17:35:47Z","title":"DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:33.405224Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2506.20639"},"observation_digest":"sha256:07a2e9730611a16e279d880316265586667af25dbe3aa9d424676eb870d56253","observation_id":"6941bb93-5eb0-4e45-b145-5b5565d57b65","resolution":{"observed_at":"2026-08-06T22:52:33.405224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-06T19:14:28.540938Z","title":"dkv-cache: The cache for diffusion language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06203","last_updated":"2025-07-10T16:43:36Z","snapshot_observed_at":"2026-08-07T04:57:37.201438Z","submitted_at":"2025-07-08T17:29:07Z","title":"A Survey on Latent Reasoning","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T19:14:28.540938Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2507.06203"},"observation_digest":"sha256:9b4c4e9fe9c04e148ea9e1c66a08abad3c8a57bd6fa77fc4df14aa87c12886ef","observation_id":"bb92a70d-9c28-4eb9-878d-5d5f4c48404a","resolution":{"observed_at":"2026-08-06T19:14:28.540938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T20:15:17.393655Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10875","last_updated":"2026-06-04T15:16:30Z","snapshot_observed_at":"2026-08-14T22:08:05.272757Z","submitted_at":"2025-08-14T17:47:22Z","title":"A Survey on Diffusion Language Models","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T20:15:17.393655Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2508.10875"},"observation_digest":"sha256:4aeaed0c4b021fc28cb9888e6e530480154d22413d0db7e8f517ca4ffdcbc62b","observation_id":"7b2866a9-6c9f-4432-ae40-d0389d24191f","resolution":{"observed_at":"2026-08-05T20:15:17.393655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2508.19982","last_updated":"2026-04-09T08:29:43Z","snapshot_observed_at":"2026-08-13T18:19:03.833249Z","submitted_at":"2025-08-27T15:40:25Z","title":"Diffusion Language Models Know the Answer Before Decoding","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T20:30:58.012632Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2508.19982"},"observation_digest":"sha256:7a08491b18e0a0df3fafc99ce49818b18f917815a8d70ca528c96a6c878472c7","observation_id":"f8941ab3-2b1b-4ce5-a71c-4434fa74b735","resolution":{"observed_at":"2026-05-18T20:31:50.415030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T13:20:05.330538Z","title":"dkv-cache: The cache for diffusion language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01025","last_updated":"2025-09-07T22:48:13Z","snapshot_observed_at":"2026-08-06T04:06:34.224683Z","submitted_at":"2025-08-31T23:34:53Z","title":"Any-Order Flexible Length Masked Diffusion","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T13:20:05.330538Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2509.01025"},"observation_digest":"sha256:3faff17d1396593247961d58fee1a1fce74ae57b5f9dda24392398338d9c9091","observation_id":"770ad0a3-9959-4b7b-b7b3-034dfbec74ef","resolution":{"observed_at":"2026-08-05T13:20:05.330538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T12:56:35.133359Z","title":"dkv-cache: The cache for diffusion language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01142","last_updated":"2025-09-01T05:30:56Z","snapshot_observed_at":"2026-08-15T08:43:47.691420Z","submitted_at":"2025-09-01T05:30:56Z","title":"Dream-Coder 7B: An Open Diffusion Language Model for Code","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T12:56:35.133359Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2509.01142"},"observation_digest":"sha256:ca572644925a1f5f3e3dd8868924f9d4c0da32de4230d2f4a34d0a13a637129c","observation_id":"f0a99398-f71d-4447-a778-3873a46791e0","resolution":{"observed_at":"2026-08-05T12:56:35.133359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T10:24:24.060171Z","title":"dkv-cache: The cache for diffusion language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04185","last_updated":"2025-09-04T13:02:39Z","snapshot_observed_at":"2026-08-15T00:39:58.408075Z","submitted_at":"2025-09-04T13:02:39Z","title":"Set Block Decoding is a Language Model Inference Accelerator","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T10:24:24.060171Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2509.04185"},"observation_digest":"sha256:df651daf4f86775520a26b2771b52a0af53733e66e774998782244fa84e82803","observation_id":"cfd3a2b9-906e-428f-bfa2-e351a926b3e9","resolution":{"observed_at":"2026-08-05T10:24:24.060171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-04T22:56:05.212046Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06949","last_updated":"2025-09-08T17:58:06Z","snapshot_observed_at":"2026-08-14T20:38:08.942762Z","submitted_at":"2025-09-08T17:58:06Z","title":"Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T22:56:05.212046Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2509.06949"},"observation_digest":"sha256:3b9aa36f8968f9743ff26297e13dac23e5494b20cbc9bc33e9e1c0575cb2a764","observation_id":"713aadc2-9b0a-4e00-9321-87bea02c3a44","resolution":{"observed_at":"2026-08-04T22:56:05.212046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-04T17:57:47.001151Z","title":"dkv-cache: The cache for diffusion language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10396","last_updated":"2025-09-12T16:44:31Z","snapshot_observed_at":"2026-08-12T01:25:18.465764Z","submitted_at":"2025-09-12T16:44:31Z","title":"Inpainting-Guided Policy Optimization for Diffusion Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T17:57:47.001151Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2509.10396"},"observation_digest":"sha256:7d0d0dd3bc4ea1b8eb0540a60ea52dd3ece0da9ffa7953a93f741b725a47da52","observation_id":"5164ca18-0a62-4bca-95d6-e41445003700","resolution":{"observed_at":"2026-08-04T17:57:47.001151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-04T16:07:02.053450Z","title":"dkv-cache: The cache for diffusion language models.arXiv preprint arXiv:2505.15781,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.16518","last_updated":"2026-06-04T19:42:40Z","snapshot_observed_at":"2026-08-14T00:16:34.761331Z","submitted_at":"2025-09-20T03:48:32Z","title":"FG-Attn: Leveraging Fine-Grained Sparse Attention in Video Diffusion Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:02.053450Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2509.16518"},"observation_digest":"sha256:c86565cf1b84133e85518e9d6d65271457d26f33d6d70ab6e98c398b8a0e235e","observation_id":"ada3d51b-d88f-4f0c-9efb-4ee388a51dee","resolution":{"observed_at":"2026-08-04T16:07:02.053450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-04T15:58:14.912908Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.18085","last_updated":"2026-06-11T00:26:51Z","snapshot_observed_at":"2026-08-13T05:15:01.921580Z","submitted_at":"2025-09-22T17:58:21Z","title":"Structuring The Future: Diffusion LLM Speculative Decoding via Calibrated Draft Graphs","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T15:58:14.912908Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2509.18085"},"observation_digest":"sha256:f142e9d2e613640acbe797c4c55f5e3b45bbca5d872fc9e9f7b3187837fd49b4","observation_id":"3c195442-0851-4953-9a58-2faf33441f1d","resolution":{"observed_at":"2026-08-04T15:58:14.912908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-04T11:38:52.560659Z","title":"dkv-cache: The cache for diffusion language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04019","last_updated":"2026-07-23T05:31:21Z","snapshot_observed_at":"2026-08-07T13:06:58.891938Z","submitted_at":"2025-10-05T03:53:16Z","title":"Simple Policy Gradients for Reasoning with Diffusion Language Models","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:52.560659Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2510.04019"},"observation_digest":"sha256:0c51239b49c980d448f4728238ab7b797a79f37574e6110a2bb07208d5b7813d","observation_id":"20102168-ea77-4daf-aa1d-3256cd232747","resolution":{"observed_at":"2026-08-04T11:38:52.560659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2510.04525","last_updated":"2025-10-31T05:31:58Z","snapshot_observed_at":"2026-08-13T07:57:11.259878Z","submitted_at":"2025-10-06T06:30:22Z","title":"Demystifying MaskGIT Sampler and Beyond: Adaptive Order Selection in Masked Diffusion","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T10:06:40.530902Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2510.04525"},"observation_digest":"sha256:cbb8eaa3e85fb09a7eb9a45bdb2c2b4b2e4922cc75a2eec87a4c0b5e0113f99d","observation_id":"331f9718-0159-4aa8-862a-5a2cbbbdd361","resolution":{"observed_at":"2026-05-18T10:11:14.611613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-03T21:31:34.904750Z","title":"dkv-cache: The cache for diffusion language models.arXiv preprint arXiv:2505.15781, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.15098","last_updated":"2026-06-21T15:38:16Z","snapshot_observed_at":"2026-08-14T07:24:20.183029Z","submitted_at":"2025-11-19T04:13:36Z","title":"A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T21:31:34.904750Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2511.15098"},"observation_digest":"sha256:abf02fd6ad67438de9e8f46cc728b46bba2a28c6962dac5ff937d4cf0a602ff2","observation_id":"299cd264-8b51-4e98-bfba-b468464c6992","resolution":{"observed_at":"2026-08-03T21:31:34.904750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-03T21:20:35.469650Z","title":"dkv-cache: The cache for diffusion language models.arXiv preprint arXiv:2505.15781,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-10T19:05:29.876035Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:35.469650Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:9071821d6f89f9a13e95027145de047a95782b727ddbfc1cf93bb3818f07e5ce","observation_id":"9493dd07-a51c-4254-85f7-ecb47e6eecdb","resolution":{"observed_at":"2026-08-03T21:20:35.469650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-03T16:21:35.294723Z","title":"dkv-cache: The cache for diffusion language models.arXiv preprint arXiv:2505.15781, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:35.294723Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:9f77ffdc540b7ca2e05fd961b941ea43b66b1d260757427a4903545ee66a0236","observation_id":"c1cad497-ab5f-4dac-90b2-9ee8ba46a4b2","resolution":{"observed_at":"2026-08-03T16:21:35.294723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2512.14067","last_updated":"2026-04-29T20:52:08Z","snapshot_observed_at":"2026-08-13T02:27:38.752907Z","submitted_at":"2025-12-16T04:12:17Z","title":"Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T22:29:08.669964Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2512.14067"},"observation_digest":"sha256:2878245e737a9239e21618a01ac10c2ced5583f7c697ff7b1f627b868d21594a","observation_id":"6c029df7-316a-4645-b054-41d5d7ef96b2","resolution":{"observed_at":"2026-05-16T22:31:19.277458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-03T04:24:05.894101Z","title":"dkv-cache: The cache for diffusion language models.arXiv preprint arXiv:2505.15781,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.05305","last_updated":"2026-07-03T13:47:53Z","snapshot_observed_at":"2026-08-06T04:49:30.340728Z","submitted_at":"2026-02-05T04:57:21Z","title":"FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T04:24:05.894101Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2602.05305"},"observation_digest":"sha256:59cbbadbd4be2c171c3c3cfa266a39d53f7fe7e4eb06f071fbd65f500ffaaab0","observation_id":"adf646da-4de1-4373-8851-da2335f752ce","resolution":{"observed_at":"2026-08-03T04:24:05.894101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-03T04:07:43.895110Z","title":"dkv-cache: The cache for diffusion language models.arXiv preprint arXiv:2505.15781,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.05992","last_updated":"2026-06-17T04:52:05Z","snapshot_observed_at":"2026-08-14T07:32:24.829059Z","submitted_at":"2026-02-05T18:41:38Z","title":"DSB: Dynamic Sliding Block Scheduling for Diffusion LLMs","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T04:07:43.895110Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2602.05992"},"observation_digest":"sha256:b593f745e18ce95355381ddbd6f5d1cd99411eb4dc78ea9459099cfd3cabd5e9","observation_id":"d1b1075d-ff89-45f9-bf6b-4045f15d8ba6","resolution":{"observed_at":"2026-08-03T04:07:43.895110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-04T06:06:06.779366Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11133","last_updated":"2026-08-02T20:20:48Z","snapshot_observed_at":"2026-08-13T14:59:43.905960Z","submitted_at":"2026-02-11T18:44:04Z","title":"Just on Time: Token-Level Early Stopping for Diffusion Language Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T06:06:06.779366Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2602.11133"},"observation_digest":"sha256:f4c2abebeb416d6d965f055c6792d8be7792d236a26b7685e783d277b4553f16","observation_id":"2b6eb4e3-9429-4b5a-8254-4ccc8ad584db","resolution":{"observed_at":"2026-08-04T06:06:06.779366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2603.07475","last_updated":"2026-08-02T20:40:52Z","snapshot_observed_at":"2026-08-06T23:24:21.844380Z","submitted_at":"2026-03-08T05:31:52Z","title":"A Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T15:03:23.792608Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2603.07475"},"observation_digest":"sha256:9edd993b16a1fd2fa9ac0565550c9d817708956e462cfb92e4b73fdb3d04c5e4","observation_id":"4808324c-c034-445b-8ebd-7de1a882e5dc","resolution":{"observed_at":"2026-05-15T15:06:10.088470Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-04T05:57:08.013699Z","title":"dkv-cache: The cache for diffusion language models.arXiv preprint arXiv:2505.15781,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.07475","last_updated":"2026-08-02T20:40:52Z","snapshot_observed_at":"2026-08-06T23:24:21.844380Z","submitted_at":"2026-03-08T05:31:52Z","title":"A Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMs","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T05:57:08.013699Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2603.07475"},"observation_digest":"sha256:8bd01d80fd15921a1e38e26e8960cfb6d05e2aadce33a3ed76c70023efff8a30","observation_id":"16271fa4-81d2-439a-817a-b48eb8f553ca","resolution":{"observed_at":"2026-08-04T05:57:08.013699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2604.05250","last_updated":"2026-04-06T23:23:57Z","snapshot_observed_at":"2026-08-13T19:45:03.306973Z","submitted_at":"2026-04-06T23:23:57Z","title":"DualDiffusion: A Speculative Decoding Strategy for Masked Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T18:46:57.123262Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2604.05250"},"observation_digest":"sha256:92ada8211f08782d5c147f6a8e12f072042f18f34a508eb4d7e8313764bc3a84","observation_id":"e2ef35a8-8413-4c99-8683-5048a3db85e0","resolution":{"observed_at":"2026-05-10T23:55:52.485178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2604.08302","last_updated":"2026-05-15T04:19:14Z","snapshot_observed_at":"2026-08-12T18:40:27.785502Z","submitted_at":"2026-04-09T14:35:42Z","title":"DMax: Aggressive Parallel Decoding for dLLMs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T17:58:17.880199Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2604.08302"},"observation_digest":"sha256:4198c08f0f79af9e2f1aa6abaa711eb1d3f94e65214ffb1ae42643dff69d9aae","observation_id":"6d7e55cf-f729-4d97-a729-1088a0042f10","resolution":{"observed_at":"2026-05-11T05:45:55.915284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2604.08302","last_updated":"2026-05-15T04:19:14Z","snapshot_observed_at":"2026-08-12T18:40:27.785502Z","submitted_at":"2026-04-09T14:35:42Z","title":"DMax: Aggressive Parallel Decoding for dLLMs","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T16:46:56.743268Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2604.08302"},"observation_digest":"sha256:2531b135baea1da73f68419083fe9e06cb8cdce61beb107e0692e60b974dfacd","observation_id":"5d555c91-64eb-4ac2-bef7-a9d3b48b7942","resolution":{"observed_at":"2026-05-19T16:47:40.235722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2604.17068","last_updated":"2026-04-18T17:04:10Z","snapshot_observed_at":"2026-08-15T04:42:48.530099Z","submitted_at":"2026-04-18T17:04:10Z","title":"Stability-Weighted Decoding for Diffusion Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T06:12:37.804816Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2604.17068"},"observation_digest":"sha256:b65baf3cdbe8584e0635eb74b3724b69090c62cdf62b78b298f75030fc412c4e","observation_id":"78e334c2-02dc-4f4a-ba76-71c3bdfa198c","resolution":{"observed_at":"2026-05-10T06:31:31.324664Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2604.18995","last_updated":"2026-06-02T03:22:46Z","snapshot_observed_at":"2026-08-11T18:23:30.317276Z","submitted_at":"2026-04-21T02:26:08Z","title":"$R^2$-dLLM: Accelerating Diffusion Large Language Models via Spatio-Temporal Redundancy Reduction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T02:56:32.367404Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2604.18995"},"observation_digest":"sha256:bab037f23cfc95159c877d9afeed0326adf04f6acda676e9755c18746ca24f70","observation_id":"310c6f96-9478-4eb9-a715-a3d081ab485d","resolution":{"observed_at":"2026-05-11T12:46:25.680494Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2605.00161","last_updated":"2026-05-30T05:41:01Z","snapshot_observed_at":"2026-08-15T09:30:13.300837Z","submitted_at":"2026-04-30T19:31:02Z","title":"Consistent Diffusion Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-09T20:59:46.082251Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2605.00161"},"observation_digest":"sha256:5bbc0dcfba591a7aca47354db4668e1da6b7122f0b52eb53392a01b752d262f4","observation_id":"0ade42e0-49f4-40b7-8f9e-b5c8cbadd279","resolution":{"observed_at":"2026-05-11T14:51:04.836536Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2605.08134","last_updated":"2026-05-01T19:15:45Z","snapshot_observed_at":"2026-08-11T12:48:11.902760Z","submitted_at":"2026-05-01T19:15:45Z","title":"DARE: Diffusion Language Model Activation Reuse for Efficient Inference","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-12T03:24:00.494716Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2605.08134"},"observation_digest":"sha256:a74cbb097dae97d0b664a6585add4ad27a182f3da90e1c3fe845884f294707a6","observation_id":"5af9c771-90fd-4ed2-bac0-16cae20bfb1a","resolution":{"observed_at":"2026-05-12T03:26:19.682913Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2605.09536","last_updated":"2026-05-10T13:38:53Z","snapshot_observed_at":"2026-07-06T23:21:35.327066Z","submitted_at":"2026-05-10T13:38:53Z","title":"TAD: Temporal-Aware Trajectory Self-Distillation for Fast and Accurate Diffusion LLM","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T05:01:03.570848Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2605.09536"},"observation_digest":"sha256:2c1a1f6acfe4fb6b38e7a45feadcba0b782786b409cdb848419cad4bf369df04","observation_id":"eb660baa-c8eb-4e48-aa34-f8b1c3d458db","resolution":{"observed_at":"2026-05-12T05:46:26.034064Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2605.09999","last_updated":"2026-05-11T05:21:52Z","snapshot_observed_at":"2026-08-11T14:42:23.697451Z","submitted_at":"2026-05-11T05:21:52Z","title":"Muninn: Your Trajectory Diffusion Model But Faster","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T03:49:48.492957Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2605.09999"},"observation_digest":"sha256:615e91a42491eb9d049e64f443d49fd94e1bdf91aa2272bbd525761ffdd8efad","observation_id":"7d11f95d-593e-439c-ac6e-7a3270ccf72c","resolution":{"observed_at":"2026-05-12T06:56:27.588353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2605.12825","last_updated":"2026-05-17T06:15:57Z","snapshot_observed_at":"2026-08-02T22:38:42.397013Z","submitted_at":"2026-05-12T23:47:35Z","title":"Orthrus: Memory-Efficient Parallel Token Generation via Dual-View Diffusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T19:49:16.478833Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2605.12825"},"observation_digest":"sha256:351071786abccb63eedadbbf2e84d0983be4d74e2e86baa01ebd56684718c220","observation_id":"92bd7f62-ca1c-48fa-ab44-1f56159ff89d","resolution":{"observed_at":"2026-05-14T19:49:24.893227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2605.12825","last_updated":"2026-05-17T06:15:57Z","snapshot_observed_at":"2026-08-02T22:38:42.397013Z","submitted_at":"2026-05-12T23:47:35Z","title":"Orthrus: Memory-Efficient Parallel Token Generation via Dual-View Diffusion","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T21:37:58.464075Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2605.12825"},"observation_digest":"sha256:2e64cca6ddf731ff4cad48af7d57b4082dfa33ceea5184f774fec529e5561926","observation_id":"d90ca113-b18f-48ef-a912-73b75de7a72f","resolution":{"observed_at":"2026-05-20T21:39:03.370154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2605.18165","last_updated":"2026-05-18T10:09:10Z","snapshot_observed_at":"2026-08-13T02:41:01.080646Z","submitted_at":"2026-05-18T10:09:10Z","title":"Elastic-dLLM: Position Preserving Context Compression and Augmentation of Diffusion LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T13:13:05.695349Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2605.18165"},"observation_digest":"sha256:bac94e156f42922c20f5aa25faafa7a77eee3910040e74475da40a8777471e7b","observation_id":"7d8be878-a96a-45e4-8166-14c00b6596cb","resolution":{"observed_at":"2026-05-20T13:13:17.907799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2605.19470","last_updated":"2026-05-19T07:22:17Z","snapshot_observed_at":"2026-08-13T17:52:10.312145Z","submitted_at":"2026-05-19T07:22:17Z","title":"Drifting Objectives for Refining Discrete Diffusion Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T06:18:06.115984Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2605.19470"},"observation_digest":"sha256:c0bb1a7fc182ecdbd372e6b71ba7f362f00627c77cc2e62067a128aa8e75148b","observation_id":"055c3160-77b4-43e7-80d1-af16600d9bf7","resolution":{"observed_at":"2026-05-20T06:23:05.629856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2605.20179","last_updated":"2026-05-19T17:59:08Z","snapshot_observed_at":"2026-08-15T14:55:24.848284Z","submitted_at":"2026-05-19T17:59:08Z","title":"TIDE: Efficient and Lossless MoE Diffusion LLM Inference with I/O-aware Expert Offload","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T05:08:07.318040Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2605.20179"},"observation_digest":"sha256:d4b65f0250a2b8d8642b2a9dff5f7aff48222c42eac53f92c75024ce6fed5a73","observation_id":"6bb5c8fc-a2bc-4180-8bb0-5ba106576c76","resolution":{"observed_at":"2026-05-20T05:13:03.704690Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2605.20813","last_updated":"2026-05-20T07:06:54Z","snapshot_observed_at":"2026-08-13T02:25:35.870251Z","submitted_at":"2026-05-20T07:06:54Z","title":"PulseCol: Periodically Refreshed Column-Sparse Attention for Accelerating Diffusion Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T05:05:55.767705Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2605.20813"},"observation_digest":"sha256:7fdf01efbef1a9dd2e82ff19599fc23ce0b00d5680d7b83ac03fe72abd42dff3","observation_id":"3ae9365c-3c58-440a-aa3d-d960936d841a","resolution":{"observed_at":"2026-05-21T05:09:38.702899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2606.00724","last_updated":"2026-05-30T13:32:26Z","snapshot_observed_at":"2026-08-13T12:51:37.389110Z","submitted_at":"2026-05-30T13:32:26Z","title":"WaveFilter: Enhancing the Long-Context Capability of Diffusion LLMs via Wavelet-Guided KV Cache Filtering","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T18:57:54.491506Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2606.00724"},"observation_digest":"sha256:4c26c3a23333a58f8159570bb594184de13e99fd89003a54e1b044a2268f0a3d","observation_id":"80f1760e-6b83-4097-9fd4-aaf2514d27a0","resolution":{"observed_at":"2026-06-28T19:02:33.539893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2606.02544","last_updated":"2026-08-08T18:55:15Z","snapshot_observed_at":"2026-08-15T11:39:14.440665Z","submitted_at":"2026-06-01T17:46:46Z","title":"SimSD: Simple Speculative Decoding in Diffusion Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T14:58:00.723105Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2606.02544"},"observation_digest":"sha256:5691b38d1b65228aee441bb1a8355cf80118c9d0dd583821ab11f43df00e126c","observation_id":"dded29b5-222b-4259-b60b-1eea4953b0cc","resolution":{"observed_at":"2026-07-01T22:56:19.572445Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2606.08411","last_updated":"2026-06-07T02:24:11Z","snapshot_observed_at":"2026-08-15T05:06:31.853312Z","submitted_at":"2026-06-07T02:24:11Z","title":"AsyncLane: Decoupling Refinement from Advancement in Diffusion Language Model Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T18:55:09.942488Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2606.08411"},"observation_digest":"sha256:5df97a902bfe553772ac4534ded32cb117e239a77450d84b02c3584b2ed46e2e","observation_id":"2d70d8ab-8310-4dee-80c9-bc82ec4e273b","resolution":{"observed_at":"2026-07-02T22:27:25.768144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2606.25331","last_updated":"2026-06-24T02:51:36Z","snapshot_observed_at":"2026-08-14T14:03:12.603128Z","submitted_at":"2026-06-24T02:51:36Z","title":"Improved Large Language Diffusion Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-25T21:34:45.620481Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2606.25331"},"observation_digest":"sha256:5786e476e8ca86e385edd52067b3f7461b1bdce8b6a33d38101704456f1aac36","observation_id":"e6d94c8c-7f0f-43ff-b91d-d76c320357e3","resolution":{"observed_at":"2026-07-04T19:20:05.600761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2606.26120","last_updated":"2026-05-27T02:47:50Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-05-27T02:47:50Z","title":"Dynamic-dLLM: Dynamic Cache-Budget and Adaptive Parallel Decoding for Training-Free Acceleration of Diffusion LLM","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T13:27:45.796650Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2606.26120"},"observation_digest":"sha256:39c37d2c44ad3739723734676a2c015d2a96e6075bf3794aae4cfe81ad61c056","observation_id":"29e0803d-f212-4e95-8759-6331721d0d88","resolution":{"observed_at":"2026-06-29T13:33:28.295423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2606.29814","last_updated":"2026-07-15T22:31:14Z","snapshot_observed_at":"2026-08-02T09:39:29.759731Z","submitted_at":"2026-06-29T05:48:41Z","title":"Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T06:07:55.600338Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2606.29814"},"observation_digest":"sha256:bc70bb6c90813e85897b11f998fa79d39bee4f2c63add6964f362665cdee508c","observation_id":"01addc37-21fe-42fb-bc40-435440b1cf1d","resolution":{"observed_at":"2026-06-30T08:14:26.594399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-02T09:39:33.236358Z","title":"dkv-cache: The cache for diffusion language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29814","last_updated":"2026-07-15T22:31:14Z","snapshot_observed_at":"2026-08-02T09:39:29.759731Z","submitted_at":"2026-06-29T05:48:41Z","title":"Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T09:39:33.236358Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2606.29814"},"observation_digest":"sha256:179e8eb7f6aaf18fed4386744af7d7a9a6ca31be7fc21b8868838227b2254f13","observation_id":"56d813eb-b96a-48c9-8663-7998a002160d","resolution":{"observed_at":"2026-08-02T09:39:33.236358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2607.01775","last_updated":"2026-07-02T06:45:43Z","snapshot_observed_at":"2026-08-05T08:13:48.395073Z","submitted_at":"2026-07-02T06:45:43Z","title":"Set Diffusion: Interpolating Token Orderings Between Autoregression and Diffusion for Fast and Flexible Decoding","version":1},"reference_index":139,"source":"arxiv_source","source_observed_at":"2026-07-03T17:30:39.458521Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2607.01775"},"observation_digest":"sha256:4ddb5158af6d6e6021f2703fb99d319c11d3b994066a155cb72f20208ba8f146","observation_id":"424817c7-15e2-425a-baa3-08ed58b79c58","resolution":{"observed_at":"2026-07-03T17:38:43.633789Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-07-12T06:56:40.273325Z","title":"arXiv preprint arXiv:2505.15781 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02805","last_updated":"2026-07-02T22:37:43Z","snapshot_observed_at":"2026-08-15T07:14:41.217180Z","submitted_at":"2026-07-02T22:37:43Z","title":"Training Hybrid Block Diffusion Language Models with Partial Bidirectionality","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-12T06:56:40.273325Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2607.02805"},"observation_digest":"sha256:feaeec5bdd847a8c49bba4db7e7e1fdc88002d83574697d608dab59918c47b99","observation_id":"8a3d6f89-a2fe-45f7-8af4-b0154b74d73a","resolution":{"observed_at":"2026-07-12T06:56:40.273325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-07-11T13:03:39.236118Z","title":"arXiv preprint arXiv:2505.15781 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-14T16:33:54.686738Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-11T13:03:39.236118Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:9d2920e9062641822919a00b3228579071abb8ffd4bb7474d32d0e7e5909f141","observation_id":"f67277e8-3340-4071-9266-a28eb77da737","resolution":{"observed_at":"2026-07-11T13:03:39.236118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-07-14T16:21:05.570023Z","title":"arXiv preprint arXiv:2505.15781 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04819","last_updated":"2026-07-13T09:12:14Z","snapshot_observed_at":"2026-08-14T16:33:54.686738Z","submitted_at":"2026-07-06T08:51:22Z","title":"Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-14T16:21:05.570023Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2607.04819"},"observation_digest":"sha256:b2e6857ae831c98bb37ed0e0a8b2d8215af3ea9d9841dc70d5c2e250e4c35e0a","observation_id":"eef39733-e605-43c6-869d-308e4a8ef461","resolution":{"observed_at":"2026-07-14T16:21:05.570023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2505.15781","doi":"10.48550/arxiv.2505.15781","metadata_source":"pith","pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"dkv-cache: The cache for diffusion language models","venue":"cs.CL","work_id":"8bba2afd-bafd-4ccb-af6d-58855e9f3967","year":2025},"citing_paper":{"arxiv_id":"2607.05722","last_updated":"2026-07-07T01:09:54Z","snapshot_observed_at":"2026-08-06T13:45:31.949136Z","submitted_at":"2026-07-07T01:09:54Z","title":"Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-11T03:04:12.500342Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2607.05722"},"observation_digest":"sha256:9622e46844b05af57fec7062be36e785b7fe9bcd739b020ad337d2ca9f0c15b5","observation_id":"a6be4ad2-c798-4782-842c-e59f1aae65fb","resolution":{"observed_at":"2026-07-11T03:07:52.108528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-02T14:46:39.626083Z","title":"dkv-cache: The cache for diffusion language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14107","last_updated":"2026-05-07T18:05:39Z","snapshot_observed_at":"2026-08-14T18:08:28.684752Z","submitted_at":"2026-05-07T18:05:39Z","title":"Polestar: Drift-Aware Cache Calibration and Token Commitment for Efficient Inference of Diffusion LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T14:46:39.626083Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2607.14107"},"observation_digest":"sha256:e325427d6381f9b5cff396b2795f6cbd9fec1d9ad60b7102f4d1451038a30959","observation_id":"d6ef4718-def9-4b1a-9c79-306795d83737","resolution":{"observed_at":"2026-08-02T14:46:39.626083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-02T01:48:53.941991Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14557","last_updated":"2026-07-16T04:37:02Z","snapshot_observed_at":"2026-08-07T01:49:31.068808Z","submitted_at":"2026-07-16T04:37:02Z","title":"Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T01:48:53.941991Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2607.14557"},"observation_digest":"sha256:f8ca92416faf01272412b1ad733c2579dd9c1bbd2d8ab76376392ac41938a27b","observation_id":"e6c2e671-5f8e-45e7-9a47-c16eba3394e6","resolution":{"observed_at":"2026-08-02T01:48:53.941991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-01T23:55:56.796892Z","title":"dkv-cache: The cache for diffusion language models.arXiv preprint arXiv:2505.15781,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15200","last_updated":"2026-07-16T16:57:34Z","snapshot_observed_at":"2026-08-14T15:48:09.191207Z","submitted_at":"2026-07-16T16:57:34Z","title":"Mask-Aware Policy Gradients for Diffusion Language Models","version":1},"reference_index":1959,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:56.796892Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2607.15200"},"observation_digest":"sha256:70ac5310ad49810660eff22e50357e3065ef63ff9a38dd7b68db1743553a5ec5","observation_id":"af10b56e-ac39-4055-9166-e4182e424d5e","resolution":{"observed_at":"2026-08-01T23:55:56.796892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-01T17:28:55.370896Z","title":"InProceedings of the 41st International Conference on Ma- chine Learning, ICML’24","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17652","last_updated":"2026-07-20T08:05:03Z","snapshot_observed_at":"2026-08-10T16:32:01.863002Z","submitted_at":"2026-07-20T08:05:03Z","title":"FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T17:28:55.370896Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2607.17652"},"observation_digest":"sha256:430cb2c964874da5313b0ca09d0e61db55a95d85ec72ed47be6f421b6b48a1b4","observation_id":"a4da808d-e1b9-405c-a5dd-9b39decee86b","resolution":{"observed_at":"2026-08-01T17:28:55.370896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-04T22:20:08.739938Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01717","last_updated":"2026-08-03T05:28:37Z","snapshot_observed_at":"2026-08-13T18:43:27.150082Z","submitted_at":"2026-08-03T05:28:37Z","title":"Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T22:20:08.739938Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2608.01717"},"observation_digest":"sha256:dcea1f591ec4e251e97324715cde2d65f29fc3443cdd89cd18d6577df54e2b5a","observation_id":"6d711fa9-e3f3-4e83-a04e-2a99c6136159","resolution":{"observed_at":"2026-08-04T22:20:08.739938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15781/citation-record","integrity":"/paper/2505.15781/integrity","json":"/paper/2505.15781/citation-record.json","paper":"/paper/2505.15781"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-07T15:17:06.940236Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:06.940236Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:07014b6e4bff1c963c63abc44034de9dbbc388220b365353d57178ac91db31fe","observation_id":"d05c9d99-b5af-4e7b-a497-4beefb4de395","resolution":{"observed_at":"2026-08-07T15:17:06.940236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09573","last_updated":"2025-05-17T21:15:02Z","snapshot_observed_at":"2026-08-14T13:55:40.999046Z","submitted_at":"2025-03-12T17:43:40Z","title":"Block Diffusion: Interpolating Between Autoregressive and Diffusion Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09573","snapshot_observed_at":"2026-08-07T15:17:07.009204Z","title":"Block diffusion: Interpolating between autoregressive and diffusion language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:07.009204Z"},"links":{"cited_paper":"/paper/2503.09573","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:b4eeaf7bc2eb0870d59867f70d6a3b83a4d88db21e9efee743f057f20f24e6a3","observation_id":"ce32cf25-2178-4f26-8a00-1d88bb8d9c1a","resolution":{"observed_at":"2026-08-07T15:17:07.009204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:07.083993Z","title":"Structured denoising diffusion models in discrete state-spaces","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:07.083993Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:839d045291b28269d3c46078b458af00a6b33a49546bfc96bf4587f882bf06c6","observation_id":"0d3d7e69-803a-4889-9444-57ca3482b62e","resolution":{"observed_at":"2026-08-07T15:17:07.083993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T15:17:07.168476Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:07.168476Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:eb68ca2f07320a9b5b1c9731c5d7a715be5075e3101eea19395494f32a295348","observation_id":"e861401a-1c08-42eb-8d2c-1b35a8ce5562","resolution":{"observed_at":"2026-08-07T15:17:07.168476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:07.237903Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:07.237903Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:d86d6c49caa03d9e9f2c9ea798ab67393fb274fc4cafe49190d0af2a8a145432","observation_id":"f85dc10b-0f3b-4eb4-a762-ab34671fd6b6","resolution":{"observed_at":"2026-08-07T15:17:07.237903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:07.324688Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:07.324688Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:87861a8c8f0e6ef504a3cc3ec4acbdb143ec96474362213877b1fd5e2867068f","observation_id":"08757232-9387-432b-9814-3319b9183966","resolution":{"observed_at":"2026-08-07T15:17:07.324688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:07.390260Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:07.390260Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:9ceaecf1084bc6098c9712752482337825b4e4d3aa6d1c419d02fd0f71e01283","observation_id":"c5773288-2c79-4a66-82b8-50c3b55266bd","resolution":{"observed_at":"2026-08-07T15:17:07.390260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:07.441210Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:07.441210Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:9a2154fc8c2586a3c658f4b1bd96529717c442df689733b54b0c8689453aefbe","observation_id":"cd15e5b3-4aa3-470c-94e4-d1a9ff995e55","resolution":{"observed_at":"2026-08-07T15:17:07.441210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:07.529527Z","title":"δ-dit: A training-free acceleration method tailored for diffusion transformers, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:07.529527Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:fc64dba9cf47b62327efca9299e50550b75b2ac7080e0c45ca6ec8c3bf00cc00","observation_id":"a22f5f37-c002-43e4-b38a-5c0fee3a0067","resolution":{"observed_at":"2026-08-07T15:17:07.529527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T15:17:07.579982Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:07.579982Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:5e816719b98900efeaae93bbad1ed9e718dd9ca92980b3fa2d9d92a62d369ed6","observation_id":"6b4f4beb-144e-45da-be55-b12808650134","resolution":{"observed_at":"2026-08-07T15:17:07.579982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02860","last_updated":"2019-06-02T21:21:48Z","snapshot_observed_at":"2026-08-14T17:33:04.904744Z","submitted_at":"2019-01-09T18:28:19Z","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.02860","snapshot_observed_at":"2026-08-07T15:17:07.621619Z","title":"Carbonell, Quoc V","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:07.621619Z"},"links":{"cited_paper":"/paper/1901.02860","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:d6d7f8848572c21872fa6262984a347490fc1e9bb610a22e575b06b504728de5","observation_id":"fe45d45a-23c4-4290-be30-398fa347dcd5","resolution":{"observed_at":"2026-08-07T15:17:07.621619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T15:17:07.688478Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:07.688478Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:0485b285480b2bed894ca3cad47970a9a19e3eeb26f1e42feae4a6028d2f4863","observation_id":"80bf90da-0022-4e4b-ad92-53b34b0fce99","resolution":{"observed_at":"2026-08-07T15:17:07.688478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11473","last_updated":"2024-07-10T14:36:06Z","snapshot_observed_at":"2026-08-12T23:41:10.422488Z","submitted_at":"2024-06-17T12:38:38Z","title":"Promises, Outlooks and Challenges of Diffusion Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11473","snapshot_observed_at":"2026-08-07T15:17:07.740944Z","title":"Promises, outlooks and challenges of diffusion language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:07.740944Z"},"links":{"cited_paper":"/paper/2406.11473","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:dd0c3787e4c0fdc2e827c48ff97898bd6081703d42b1f5d236ae9dee64deca11","observation_id":"3b70e492-e85d-45bd-97f0-cc251294380b","resolution":{"observed_at":"2026-08-07T15:17:07.740944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:17:07.795518Z","title":"Hartshorn, Aobo Yang, Archi Mitra, Archie Sravankumar, Artem Korenev, Arthur Hinsvark, Arun Rao, Aston Zhang, Aur’elien Rodriguez, Austen Gregerson, and Ava Spataru et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:07.795518Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:b2c79686a866befd2e99e76ff7f9aefaf69b65f76b18e9df0e63ac34a1509e4b","observation_id":"3202f12d-e617-4a7f-be45-962dd1156f31","resolution":{"observed_at":"2026-08-07T15:17:07.795518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:07.834561Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:07.834561Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:7259b277267210e2db8a65e76231443d91a5b38db97cbfb1a0727710863c70f2","observation_id":"442381c0-d1ac-49f1-94ae-520733e1c822","resolution":{"observed_at":"2026-08-07T15:17:07.834561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04825","last_updated":"2024-05-13T14:05:00Z","snapshot_observed_at":"2026-08-14T12:24:12.895232Z","submitted_at":"2024-02-07T13:23:25Z","title":"Fast Timing-Conditioned Latent Audio Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04825","snapshot_observed_at":"2026-08-07T15:17:07.900441Z","title":"Hawley, and Jordi Pons","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:07.900441Z"},"links":{"cited_paper":"/paper/2402.04825","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:2b5acd13f400ff1b29d419878724c87933a0e9c101f15a1e6c488ce05cc5bec7","observation_id":"fc99a626-6e4a-4c66-bb16-89f32f61809e","resolution":{"observed_at":"2026-08-07T15:17:07.900441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09622","last_updated":"2025-06-09T02:36:10Z","snapshot_observed_at":"2026-08-15T02:00:08.807252Z","submitted_at":"2025-02-13T18:59:47Z","title":"Theoretical Benefit and Limitation of Diffusion Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09622","snapshot_observed_at":"2026-08-07T15:17:07.986871Z","title":"Theoretical benefit and limitation of diffusion language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:07.986871Z"},"links":{"cited_paper":"/paper/2502.09622","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:619e3e6f781c6c8cdbaa3d1c9a271af73477a7d69929c31557c889a48f68b05e","observation_id":"10e23769-69f6-4a87-a5bf-2af6e0fd18ac","resolution":{"observed_at":"2026-08-07T15:17:07.986871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:17.545029Z","title":"Model tells you what to discard: Adaptive KV cache compression for LLMs","venue":null,"work_id":"8e6ab925-aecb-4c21-9fd1-acb98bcea2ea","year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:08.103768Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:b288134ff99b7293b3aca37e663da7e73572d7002a1a6cbe2407e23fe0bae97d","observation_id":"21cfeab7-9333-4cc0-bdda-4f331e1690df","resolution":{"observed_at":"2026-08-07T15:17:17.651112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17891","last_updated":"2025-05-31T07:01:57Z","snapshot_observed_at":"2026-08-15T09:00:05.244407Z","submitted_at":"2024-10-23T14:04:22Z","title":"Scaling Diffusion Language Models via Adaptation from Autoregressive Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17891","snapshot_observed_at":"2026-08-07T15:17:08.210731Z","title":"Scaling diffusion language models via adaptation from autoregressive models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:08.210731Z"},"links":{"cited_paper":"/paper/2410.17891","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:e75db08a350a91949f8c0770d80b362d7689fc86236651181560cc7815a1b625","observation_id":"04fe18c9-8299-4d4c-aea4-a0a92e36f466","resolution":{"observed_at":"2026-08-07T15:17:08.210731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.02281","last_updated":"2018-03-09T03:37:52Z","snapshot_observed_at":"2026-08-14T20:16:17.375580Z","submitted_at":"2017-11-07T04:42:48Z","title":"Non-Autoregressive Neural Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.02281","snapshot_observed_at":"2026-08-07T15:17:08.315517Z","title":"Non-autoregressive neural machine translation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:08.315517Z"},"links":{"cited_paper":"/paper/1711.02281","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:71a1128d4967fa56722f812423443d05862c8a8f609166472c941a21dffb4440","observation_id":"93894ae4-472d-4f58-b5d6-b624fb8468ee","resolution":{"observed_at":"2026-08-07T15:17:08.315517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17432","last_updated":"2023-06-26T22:31:06Z","snapshot_observed_at":"2026-08-15T15:12:19.000530Z","submitted_at":"2022-10-31T16:02:00Z","title":"SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17432","snapshot_observed_at":"2026-08-07T15:17:08.410950Z","title":"Ssd-lm: Semi-autoregressive simplex-based diffusion language model for text generation and modular control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:08.410950Z"},"links":{"cited_paper":"/paper/2210.17432","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:b7eafc409139166fbde3e958e5f9cd137b763eba4734420c62c607c5c6da2654","observation_id":"31bdf8c3-4fb5-41fc-b0d6-2bef7e2b45b1","resolution":{"observed_at":"2026-08-07T15:17:08.410950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15029","last_updated":"2022-11-30T15:41:24Z","snapshot_observed_at":"2026-08-15T19:46:08.657028Z","submitted_at":"2022-11-28T03:25:49Z","title":"DiffusionBERT: Improving Generative Masked Language Models with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15029","snapshot_observed_at":"2026-08-07T15:17:08.489553Z","title":"Diffusionbert: Improving generative masked language models with diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:08.489553Z"},"links":{"cited_paper":"/paper/2211.15029","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:724f22d36f8733502d34af99e57c079b61f11cb7b8c87ff49395c3c7825a8b64","observation_id":"7f1a713d-422c-44c3-88eb-d40fd9fa1e18","resolution":{"observed_at":"2026-08-07T15:17:08.489553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:08.571952Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:08.571952Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:481909e4df267d4cca776b0e56ebcc7092e3732be02e4f0925f9e6640c56302c","observation_id":"8371540f-a6c0-4dbf-8591-22465c2710e7","resolution":{"observed_at":"2026-08-07T15:17:08.571952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:08.645684Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:08.645684Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:27753d5f2bdcc61e630aea2e5889c1e0ced6ffd3f887de50d09a0d3f3263b7dd","observation_id":"34a4e49c-94ce-4067-9823-8c083bfe20fa","resolution":{"observed_at":"2026-08-07T15:17:08.645684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:17.366918Z","title":"Argmax flows and multinomial diffusion: Learning categorical distributions","venue":null,"work_id":"71d68bcf-f3dc-49af-b682-23f636625ad3","year":2021},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:08.763561Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:e751e01baed812c434c8508960b11c1ad181e677f4e8eaf3cd92416a5b61fa4b","observation_id":"d8d61fe8-aa86-4c2e-b094-428810c28e0a","resolution":{"observed_at":"2026-08-07T15:17:17.464278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:17.191777Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization","venue":null,"work_id":"75192e52-f659-46b9-bcee-0884ed511014","year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:08.859238Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:b7d5fc31ce82e57d9009cb8e86bc73525dc16f231bfea4f776731a127a4fab35","observation_id":"fc30a520-0657-4455-920c-843410f48a21","resolution":{"observed_at":"2026-08-07T15:17:17.269212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06768","last_updated":"2025-08-19T23:35:57Z","snapshot_observed_at":"2026-08-13T15:59:25.224905Z","submitted_at":"2025-02-10T18:47:21Z","title":"Train for the Worst, Plan for the Best: Understanding Token Ordering in Masked Diffusions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06768","snapshot_observed_at":"2026-08-07T15:17:08.927585Z","title":"Train for the worst, plan for the best: Understanding token ordering in masked diffusions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:08.927585Z"},"links":{"cited_paper":"/paper/2502.06768","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:802f5b22d908c105827ac49243cef3ca979a30b9b6451c001c730fe180a799d6","observation_id":"2ef2e5c8-0bcf-4e0b-8515-c33e7a294742","resolution":{"observed_at":"2026-08-07T15:17:08.927585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T15:17:09.027332Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:09.027332Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:95a2c507c21c2bbf13723fd75b67edc799d5690cf55fe43b1dda421cb5f0edcc","observation_id":"61a580fb-1efe-46ff-a27f-727af88d6a71","resolution":{"observed_at":"2026-08-07T15:17:09.027332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:17.056429Z","title":"Diffusion-lm improves controllable text generation","venue":null,"work_id":"d02ba9bb-01a0-4dd0-ae3d-45ab191782e8","year":2022},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:09.142491Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:48bc023b2730eba3a3b8743d703dae04f934146fc95b09b3ac68b047c833bc28","observation_id":"b9f44458-c975-4924-8176-104cc474a4ec","resolution":{"observed_at":"2026-08-07T15:17:17.107864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T15:17:09.244181Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:09.244181Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:c2a460bbb39abeee4dc6ebfb3bcba215f01eddfa9f5f22d025290a5d2c2367c6","observation_id":"07935745-9b37-4aca-8962-388f59d9e9cb","resolution":{"observed_at":"2026-08-07T15:17:09.244181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02747","last_updated":"2025-02-26T10:49:33Z","snapshot_observed_at":"2026-08-15T12:23:54.078172Z","submitted_at":"2024-04-03T13:44:41Z","title":"Faster Diffusion via Temporal Attention Decomposition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02747","snapshot_observed_at":"2026-08-07T15:17:09.373225Z","title":"Faster diffusion via temporal attention decomposition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:09.373225Z"},"links":{"cited_paper":"/paper/2404.02747","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:28ec0ac634ccf03eeb5a921d27930dfd8d13c7ab3a83ed3a538e74003fb63433","observation_id":"7c713576-3e4b-4c7e-93d5-481391f5da75","resolution":{"observed_at":"2026-08-07T15:17:09.373225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:16.797024Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time","venue":null,"work_id":"d6f3c38b-8c67-409b-97b5-178a95f67fc6","year":2023},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:09.483408Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:fa887e0fce0015516295c82dd532ee8591e9cf6db56e6c0db2e52807114d352c","observation_id":"3832a6f7-f3c8-4592-ab2b-01387b907d22","resolution":{"observed_at":"2026-08-07T15:17:16.946587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16834","last_updated":"2024-06-06T21:06:44Z","snapshot_observed_at":"2026-08-14T20:57:18.809821Z","submitted_at":"2023-10-25T17:59:12Z","title":"Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16834","snapshot_observed_at":"2026-08-07T15:17:09.558223Z","title":"Discrete diffusion modeling by estimating the ratios of the data distribution","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:09.558223Z"},"links":{"cited_paper":"/paper/2310.16834","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:69d1b433ec4a641a24ea96304e94b76df2439d25670f7f9a874e077f05cb4989","observation_id":"da770a7e-b490-4838-81d8-641dd388beb7","resolution":{"observed_at":"2026-08-07T15:17:09.558223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19355","last_updated":"2025-03-12T03:40:38Z","snapshot_observed_at":"2026-08-15T09:03:51.748328Z","submitted_at":"2024-10-25T07:24:38Z","title":"FasterCache: Training-Free Video Diffusion Model Acceleration with High Quality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19355","snapshot_observed_at":"2026-08-07T15:17:09.638645Z","title":"Fastercache: Training-free video diffusion model acceleration with high quality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:09.638645Z"},"links":{"cited_paper":"/paper/2410.19355","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:eb21f8ece33119327c55f4bddaaf7307f0b600e6d254ca31ca7299cec1dd7fe6","observation_id":"e10c49ac-c288-48f4-8a55-a96636421c25","resolution":{"observed_at":"2026-08-07T15:17:09.638645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:16.508637Z","title":"Learning-to-cache: Accelerating diffusion transformer via layer caching","venue":null,"work_id":"accde821-b707-4827-9892-94c54ffb7d7f","year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:09.759578Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:73c4f9cee51969e5e956ad6327aa439a727b9b75d76af2d62802e4e26725546c","observation_id":"847b3ef0-95d0-43f1-986b-db75d7f2a285","resolution":{"observed_at":"2026-08-07T15:17:16.637873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00858","last_updated":"2023-12-07T17:24:18Z","snapshot_observed_at":"2026-08-13T05:12:18.337935Z","submitted_at":"2023-12-01T17:01:06Z","title":"DeepCache: Accelerating Diffusion Models for Free","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00858","snapshot_observed_at":"2026-08-07T15:17:09.851359Z","title":"Deepcache: Accelerating diffusion models for free","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:09.851359Z"},"links":{"cited_paper":"/paper/2312.00858","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:8a28f37127d3593087b4154a6c9c9ca06fc85d6f401ee17351a502c2250b2afb","observation_id":"6774139a-3c52-4b1a-b855-bf15b5c43e0a","resolution":{"observed_at":"2026-08-07T15:17:09.851359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-07T15:17:09.956679Z","title":"Large language diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:09.956679Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:46e3cbecd4a2e6d13ff3d185b6fb04e2b97b9d692ff6174b9dc9bfd68ebffb71","observation_id":"8da3769a-28f8-4eb2-beb6-25c0fe66769b","resolution":{"observed_at":"2026-08-07T15:17:09.956679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:10.033613Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:10.033613Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:638e281cae6caf36502964e7bf85c2e393659e34b7ceb3600fcae1f2a824f5ae","observation_id":"961dca87-17c7-4052-ad29-4e3c70cfbc89","resolution":{"observed_at":"2026-08-07T15:17:10.033613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:16.245910Z","title":null,"venue":null,"work_id":"b94ccba0-fa2b-4b04-8176-669f46972c94","year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:10.158078Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:1b5c0f948660c9ec9d2b5977d72bede94e7121017cc5eb3c5aa87b67e1874477","observation_id":"0736b0c6-ec1e-4aea-bd60-1def8b893618","resolution":{"observed_at":"2026-08-07T15:17:16.347388Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:10.278530Z","title":"Simple and effective masked diffusion language models.Advances in Neural Information Processing Systems, 37:130136–130184, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:10.278530Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:ee9b922dc354d654a12a55b78ba23f607e5a9b420892b77be01eefb7b7978c99","observation_id":"016da777-6f73-40a7-930d-5f313f6a58b0","resolution":{"observed_at":"2026-08-07T15:17:10.278530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:10.374771Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:10.374771Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:ec746188b9c56bed09914a2f7e190b4715b2d64e0925e364e8e20b71edd48642","observation_id":"cd48e3e2-9cc5-471f-9218-0ddaa186c82d","resolution":{"observed_at":"2026-08-07T15:17:10.374771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:10.490337Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:10.490337Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:20a859864815d0f89fe1abe9ee946846ebbd901135764ecdbc1396dff460f90b","observation_id":"1568ae8c-3d2c-4031-a31d-a1b60e160ace","resolution":{"observed_at":"2026-08-07T15:17:10.490337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:17:10.571643Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:10.571643Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:301a44220b2db4e6a2b2648955a5a27a6cc7a980dc0b36cd6b1a0053245e474b","observation_id":"f7dde499-1002-4286-b178-e241e714191a","resolution":{"observed_at":"2026-08-07T15:17:10.571643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:10.669154Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:10.669154Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:fbf3383bad9426d4f597045d3a8a56c216d560e10105ca9c82f552d9c8c604d8","observation_id":"6a57f103-8d16-4add-8b9d-5f0f99a988ef","resolution":{"observed_at":"2026-08-07T15:17:10.669154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:15.989819Z","title":"Slave memories and dynamic storage allocation","venue":null,"work_id":"dbe966db-fa3d-4d38-a676-e519420e46c8","year":2006},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:10.754751Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:43e0cb7fbedccf01cceefdc6341a7feec54b2a5f327037c97f7224e93923c214","observation_id":"b209b09e-c7c4-4f87-92ba-e53803dc68d5","resolution":{"observed_at":"2026-08-07T15:17:16.104113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03209","last_updated":"2024-01-12T09:26:45Z","snapshot_observed_at":"2026-08-15T04:22:11.316850Z","submitted_at":"2023-12-06T00:51:38Z","title":"Cache Me if You Can: Accelerating Diffusion Models through Block Caching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03209","snapshot_observed_at":"2026-08-07T15:17:10.878420Z","title":"Cache me if you can: Accelerating diffusion models through block caching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:10.878420Z"},"links":{"cited_paper":"/paper/2312.03209","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:f80ac03f742dab9096bc3f6453d83021f5f4c966b4f2dd9d13e0d20ed49e8ad7","observation_id":"d326254b-26aa-4dc5-b7bd-e152f9f50cb3","resolution":{"observed_at":"2026-08-07T15:17:10.878420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:15.738582Z","title":"Ar-diffusion: Auto-regressive diffusion model for text generation","venue":null,"work_id":"ff4abae5-842a-4757-82b8-f3416b761ce9","year":2023},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:10.997385Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:5ad2b71ef8b0d352b4fbaf783d3302352f4e32e5a062fd000daede4c57a6baf1","observation_id":"0c4367ed-e031-45ea-ac39-8649264d4922","resolution":{"observed_at":"2026-08-07T15:17:15.846887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:11.084138Z","title":"SANA: Efficient high-resolution text-to-image synthesis with linear diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:11.084138Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:82895fab562884316ec7de75fd501efaa932b2647b137279f6fb86691beb9d07","observation_id":"9f122a79-e69d-4652-9c9a-26f32e0e55f1","resolution":{"observed_at":"2026-08-07T15:17:11.084138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:15.537962Z","title":"Energy-based diffusion language models for text generation","venue":null,"work_id":"3a34a9a0-fcd5-4acb-92fb-4e6a8687080a","year":2025},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:11.172206Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:d41c70c0643c8f763c0073d45b251339fa2f5aaafb7263c03a120248297fadc3","observation_id":"33d13b1c-69e2-41e7-b46c-afbc13f424fe","resolution":{"observed_at":"2026-08-07T15:17:15.631912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06091","last_updated":"2024-04-09T07:49:30Z","snapshot_observed_at":"2026-08-13T00:34:25.785067Z","submitted_at":"2024-04-09T07:49:30Z","title":"Hash3D: Training-free Acceleration for 3D Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06091","snapshot_observed_at":"2026-08-07T15:17:11.280098Z","title":"Hash3d: Training-free acceleration for 3d generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:11.280098Z"},"links":{"cited_paper":"/paper/2404.06091","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:2892dfdc0fb869c1704ae060f87ce6883d07f27a314c42dd7d0f4c8e6b1cc301","observation_id":"e4e95635-a9b0-4610-b2eb-2d948038aa1d","resolution":{"observed_at":"2026-08-07T15:17:11.280098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19805","last_updated":"2025-02-27T06:25:15Z","snapshot_observed_at":"2026-08-07T17:43:56.987173Z","submitted_at":"2025-02-27T06:25:15Z","title":"Implicit Search via Discrete Diffusion: A Study on Chess","version":1},"cited_work":{"arxiv_id":"2502.19805","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19805","snapshot_observed_at":"2026-08-07T15:17:12.916782Z","title":"Implicit Search via Discrete Diffusion: A Study on Chess","venue":"cs.LG","work_id":"e6e251e5-5d9a-4acf-9e3a-f9c9d6e2fe61","year":2025},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:11.377702Z"},"links":{"cited_paper":"/paper/2502.19805","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:c5c5f57d5d071d5188efa201f13706556a618303d9e414b53d63ecb789a70164","observation_id":"03391dca-a44f-418a-9230-cbfe3a3efb73","resolution":{"observed_at":"2026-08-07T15:17:13.002658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:11.476100Z","title":"Dream 7b, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:11.476100Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:3c56bdb2343133abf42af135a4f03cc1857d8dd968532315a87e9552662e3bdf","observation_id":"90fc0d54-9087-494d-be84-75ca98814984","resolution":{"observed_at":"2026-08-07T15:17:11.476100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10025","last_updated":"2024-05-01T02:58:30Z","snapshot_observed_at":"2026-08-13T12:40:51.164461Z","submitted_at":"2023-02-20T15:14:46Z","title":"DINOISER: Diffused Conditional Sequence Learning by Manipulating Noises","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.10025","snapshot_observed_at":"2026-08-07T15:17:11.594559Z","title":"Dinoiser: Diffused conditional sequence learning by manipulating noises","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:11.594559Z"},"links":{"cited_paper":"/paper/2302.10025","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:f21418c86a831de28fcf7d686174b526af6b79934e87c98dd89934ef7a776191","observation_id":"4cf8addb-3f0d-4edd-9639-ce1812a4f91c","resolution":{"observed_at":"2026-08-07T15:17:11.594559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:15.339452Z","title":"Ditfastattn: Attention compression for diffusion transformer models","venue":null,"work_id":"fac9765e-5c7f-49f2-af56-29c2475d7f01","year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:11.675336Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:48d2c1cc3598202f82409a4c65fc3fbece43b4ef4e7d72b523c843369f4dc426","observation_id":"cf46ebb9-6899-487f-89f6-bb4c5c3e421c","resolution":{"observed_at":"2026-08-07T15:17:15.425516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03687","last_updated":"2024-12-02T18:57:12Z","snapshot_observed_at":"2026-08-13T04:25:30.954744Z","submitted_at":"2024-02-06T04:17:44Z","title":"Pard: Permutation-Invariant Autoregressive Diffusion for Graph Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03687","snapshot_observed_at":"2026-08-07T15:17:11.747555Z","title":"Pard: Permutation-invariant autoregressive diffusion for graph generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:11.747555Z"},"links":{"cited_paper":"/paper/2402.03687","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:1f57e821c9ac55cb24f8110ac51b096e0acf1f9d5e6170d41260b45367a7b0d1","observation_id":"072fc61d-63fc-4954-b5f7-cb96c701d990","resolution":{"observed_at":"2026-08-07T15:17:11.747555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12588","last_updated":"2025-02-27T07:00:30Z","snapshot_observed_at":"2026-08-12T22:59:05.586923Z","submitted_at":"2024-08-22T17:54:21Z","title":"Real-Time Video Generation with Pyramid Attention Broadcast","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12588","snapshot_observed_at":"2026-08-07T15:17:11.838283Z","title":"Real-time video generation with pyramid attention broadcast","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:11.838283Z"},"links":{"cited_paper":"/paper/2408.12588","citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:f4a56f17f7df43d3ef4eb8fd5808d334c8786d09237310ddf3400adc2f804690","observation_id":"7bc723fc-7583-491e-bcb1-8fd552838521","resolution":{"observed_at":"2026-08-07T15:17:11.838283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:15.163370Z","title":"𝐷! Cache Step 𝑡+1 𝐾!#$","venue":null,"work_id":"c48e917b-ea59-4985-a1b7-f092259d5403","year":2024},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:11.974256Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:ec968df1b9d1b1d1df981ca334bba297763af6a1798edad4dcd4ea989a02e0db","observation_id":"37952f9a-4492-44c7-92c0-9c71dbe5ea2a","resolution":{"observed_at":"2026-08-07T15:17:15.233992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:15.001695Z","title":null,"venue":null,"work_id":"99f50879-36c2-416e-83dc-3be6034740f9","year":null},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:12.079426Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:d88f8b7cd16b3fd63e7976e9053ff71078b448f95ab8c86725ab559b17cece2b","observation_id":"c02f37d1-8261-4efa-a495-302fde36ab80","resolution":{"observed_at":"2026-08-07T15:17:15.078821Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:14.816240Z","title":null,"venue":null,"work_id":"a93a9207-b620-49bb-9a39-bf8ac38d3804","year":null},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:12.158198Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:6c359f82144fbccde7601cb11a5ab484e282dac931d9dcae319fe33a0a71e07a","observation_id":"2aabf791-52b1-4596-a33c-1a43861331ac","resolution":{"observed_at":"2026-08-07T15:17:14.898300Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:14.608315Z","title":null,"venue":null,"work_id":"5bb711c6-19a0-473a-8536-50a3db1cd068","year":null},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:12.228196Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:a9c2a9ff46ec467641350b1b869264e85ddc4c9258c04fdc84f3474d4f84739a","observation_id":"2c1da3d2-3946-490e-907d-e85f5dab13fc","resolution":{"observed_at":"2026-08-07T15:17:14.711265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:14.413393Z","title":null,"venue":null,"work_id":"0ed37c37-f631-49ab-b797-5af6ffea57ba","year":null},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:12.316610Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:3046c307586e4b75f6c5ff27b4304358dbe2a6a1138f0aac557b76c49ff4f948","observation_id":"c4e46631-6097-45ca-9f18-3a2154dc1537","resolution":{"observed_at":"2026-08-07T15:17:14.499561Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:14.209065Z","title":null,"venue":null,"work_id":"de33988b-9c41-4bb3-9037-09cea84dcf8a","year":null},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:12.406028Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:37d2e48172a9dcaaf5a1b9e2c94c6ab3a59d8fc7ee6ffa600454c83cf5d068d3","observation_id":"6de61445-bd67-41bd-a41c-ec0b854fc623","resolution":{"observed_at":"2026-08-07T15:17:14.307823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:14.010571Z","title":null,"venue":null,"work_id":"9e69a62d-5c1d-49bc-8482-35dfd89e87c2","year":null},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:12.501423Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:64a7a0eb7e15620a0db85876e4988c77b787a9d48be57f390673fcac3267048d","observation_id":"a06d0610-7aeb-41bc-a25e-5115f901b121","resolution":{"observed_at":"2026-08-07T15:17:14.101242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:13.782019Z","title":null,"venue":null,"work_id":"3d02bf0b-eff1-4969-9d01-fb51f044f596","year":null},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:12.596720Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:e4888de28c0d0c18c797160c166a15316dc5314b50fa4f1580342359c7738889","observation_id":"a4f5c423-43fd-4898-adee-48bec4ff4a7f","resolution":{"observed_at":"2026-08-07T15:17:13.898337Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:13.561659Z","title":null,"venue":null,"work_id":"53355591-db1d-40ab-9240-137bb1f190fa","year":null},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:12.689800Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:8c25e329130575f429d7406fb9f7a431b1c4e9c413c3da935f39e31f517e7659","observation_id":"b8000ca5-5234-4f80-962d-911a3013554c","resolution":{"observed_at":"2026-08-07T15:17:13.670024Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:13.383420Z","title":"Finally, Joey and Rachel get married","venue":null,"work_id":"32b685f8-e9fd-498a-9d08-e8d6507493ce","year":null},"citing_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:12.775410Z"},"links":{"citing_paper":"/paper/2505.15781"},"observation_digest":"sha256:76caa0cd524309abbb1375f9d42b90eee3ec50ef7c93943807c7d3b4287ef3d3","observation_id":"320d4906-e214-43ba-b250-3e7d27286b5c","resolution":{"observed_at":"2026-08-07T15:17:13.465605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 55 inbound Pith citation observations for arXiv:2505.15781."}