{"as_of":"2026-08-11T03:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16fb7050caba6643fffb8698435652a2565ab4707d7fed11f78ac665c17deb70","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:14:52.259504Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06628/citation-record","integrity":"/paper/2608.06628/integrity","json":"/paper/2608.06628/citation-record.json","paper":"/paper/2608.06628"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:14:52.215311Z","title":"LLaDA2.1: Speeding up text diffusion via token editing.arXiv preprint arXiv:2602.08676,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-11T03:10:59.350857Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.215311Z"},"links":{"citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:e67bcaea849dbff187e66ef647fb828f2cdd59c88585d204195985ac0aadfeb0","observation_id":"b5a2cd5a-19a3-4a67-9705-f5aaf2f93008","resolution":{"observed_at":"2026-08-10T04:14:52.215311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-10T04:14:52.227519Z","title":"T ¨ULU 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-11T03:10:59.350857Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.227519Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:b50d8a3578cc92db2200ba60f4e48fb28b09dc5d5a2675ef7a9cc130c655bcbd","observation_id":"a3bd89b5-400f-4c24-ae2a-c637e226a8f3","resolution":{"observed_at":"2026-08-10T04:14:52.227519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:14:52.234749Z","title":"The diffusion duality.arXiv preprint arXiv:2506.10892,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-11T03:10:59.350857Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.234749Z"},"links":{"citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:b9543877f8503b79cfa665d15233963f85db08be76b5b1b890e7fb401082d461","observation_id":"f2c19505-7d58-4ab0-8f26-18f9c71be134","resolution":{"observed_at":"2026-08-10T04:14:52.234749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:14:53.427564Z","title":"Simple guidance mechanisms for discrete diffusion models","venue":null,"work_id":"21423453-8fcd-4535-870b-64d3b91d9074","year":2025},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-11T03:10:59.350857Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.237955Z"},"links":{"citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:f2ffbc09e525030d41016f64a71fa57e28b53169a16b0ee3921aeeb32e00dc4f","observation_id":"23b64969-f29e-4ae8-bee2-6ee729f11043","resolution":{"observed_at":"2026-08-10T04:14:53.431302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02193","last_updated":"2025-08-04T08:43:01Z","snapshot_observed_at":"2026-07-06T22:07:21.387432Z","submitted_at":"2025-08-04T08:43:01Z","title":"Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02193","snapshot_observed_at":"2026-08-10T04:14:52.241127Z","title":"Seed diffusion: A large-scale diffusion language model with high-speed inference.arXiv preprint arXiv:2508.02193,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-11T03:10:59.350857Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.241127Z"},"links":{"cited_paper":"/paper/2508.02193","citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:4dfca5b011fa0de49044eefb835563f69fcdbb3f571a13f44987b3c971773239","observation_id":"45fde0ac-3bb3-45ff-9b5a-00564e33aa02","resolution":{"observed_at":"2026-08-10T04:14:52.241127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.19980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:14:52.852623Z","title":"Discrete diffusion models exploit asymmetry to solve lookahead planning tasks.arXiv preprint arXiv:2602.19980,","venue":null,"work_id":"96a691a4-80c2-43f9-837e-fbe8f5968aaf","year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-11T03:10:59.350857Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.244505Z"},"links":{"citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:470c6cd6d330e4b24bcec3388f074a2ecdde85f4084d4367b3fb72b5a67f20ab","observation_id":"75a91339-753f-4b2c-ade5-355164e84f6f","resolution":{"observed_at":"2026-08-10T04:14:52.860526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14157","last_updated":"2025-02-18T03:52:31Z","snapshot_observed_at":"2026-07-06T19:35:44.200337Z","submitted_at":"2024-10-18T03:48:53Z","title":"Beyond Autoregression: Discrete Diffusion for Complex Reasoning and Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14157","snapshot_observed_at":"2026-08-10T04:14:52.251220Z","title":"Beyond autoregression: Discrete diffusion for complex reasoning and planning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-11T03:10:59.350857Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.251220Z"},"links":{"cited_paper":"/paper/2410.14157","citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:de8000d74ac79f91e23b45bb7bbdc97d9aaa285ab1fbd8725c0819261b2b93c0","observation_id":"b661e5b2-1b26-4a38-8fd4-2207cde2dd89","resolution":{"observed_at":"2026-08-10T04:14:52.251220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15487","last_updated":"2025-08-21T12:09:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-21T12:09:58Z","title":"Dream 7B: Diffusion Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15487","snapshot_observed_at":"2026-08-10T04:14:52.255473Z","title":"Dream 7B: Diffusion large language models.arXiv preprint arXiv:2508.15487,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-11T03:10:59.350857Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.255473Z"},"links":{"cited_paper":"/paper/2508.15487","citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:a4fc6ba1379714c876613a9084194bd1bdc2f905ae4d61bbd037e883234d2dc5","observation_id":"dd92681b-0e94-4a2c-b337-b9e4a095f30a","resolution":{"observed_at":"2026-08-10T04:14:52.255473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:14:52.259504Z","title":"LLaDA-MoE: A sparse MoE diffusion language model.arXiv preprint arXiv:2509.24389,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-11T03:10:59.350857Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.259504Z"},"links":{"citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:d6d7c7c38556cf3001c641501bc86bb6cdf3938b4d18ac40caf3875feba5a215","observation_id":"f6e50143-e983-4ddc-aab8-923000149b22","resolution":{"observed_at":"2026-08-10T04:14:52.259504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06768","last_updated":"2025-08-19T23:35:57Z","snapshot_observed_at":"2026-08-09T09:47:58.662011Z","submitted_at":"2025-02-10T18:47:21Z","title":"Train for the Worst, Plan for the Best: Understanding Token Ordering in Masked Diffusions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06768","snapshot_observed_at":"2026-08-10T04:14:52.223396Z","title":"Train for the worst, plan for the best: Understanding token ordering in masked diffusions.arXiv preprint arXiv:2502.06768,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-11T03:10:59.350857Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.223396Z"},"links":{"cited_paper":"/paper/2502.06768","citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:3c21d6fa7a8b5a710ed5dc1460bbe28169672e28483e5110a1b3f20fb7bc22e2","observation_id":"b4fc0e3f-e488-4920-94dc-c5359c886ca1","resolution":{"observed_at":"2026-08-10T04:14:52.223396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17298","last_updated":"2025-06-17T17:06:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-17T17:06:18Z","title":"Mercury: Ultra-Fast Language Models Based on Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17298","snapshot_observed_at":"2026-08-10T04:14:52.219401Z","title":"Mercury: Ultra-fast language models based on diffu- sion.arXiv preprint arXiv:2506.17298,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-11T03:10:59.350857Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.219401Z"},"links":{"cited_paper":"/paper/2506.17298","citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:7d298b808eb8878a7a179cf3cb6361a92c6554ac20c3df0c368c4f35b7a8c501","observation_id":"57eac887-b242-4466-82b9-7facf6251a04","resolution":{"observed_at":"2026-08-10T04:14:52.219401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18467","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:14:53.202149Z","title":null,"venue":null,"work_id":"af17782a-c869-4762-b24e-7d5079065733","year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-11T03:10:59.350857Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.231187Z"},"links":{"citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:1ffa0b8e4ff04276e1bf9b018802481d2a8e5038aff69785fb5f89e6755d77a4","observation_id":"4116384a-676a-4adb-beea-c56fef673046","resolution":{"observed_at":"2026-08-10T04:14:53.207417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-08-10T07:50:38.265616Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-10T04:14:52.210581Z","title":"Tiwei Bie, Maosong Cao, Kun Chen, Lun Du, Mingliang Gong, Zhuochen Gong, Yanmei Gu, Jiaqi Hu, Zenan Huang, Zhenzhong Lan, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-11T03:10:59.350857Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.210581Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:bb442576ef9d5b5a66f9e532627290259f36516de19372e802398576da40e826","observation_id":"005303c5-fdda-42e1-911d-718910c9471c","resolution":{"observed_at":"2026-08-10T04:14:52.210581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:14:52.247619Z","title":"Scaling behavior of discrete diffusion language models.arXiv preprint arXiv:2512.10858,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","snapshot_observed_at":"2026-08-11T03:10:59.350857Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-10T04:14:52.247619Z"},"links":{"citing_paper":"/paper/2608.06628"},"observation_digest":"sha256:ea3004dde063ef78560905a2c29abe8f6614ae705ee41f04d8cda845f616b68f","observation_id":"0b87d0c0-a694-4142-bb9f-d2dfbc6d6f56","resolution":{"observed_at":"2026-08-10T04:14:52.247619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06628","last_updated":"2026-08-06T22:34:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T03:10:59.350857Z","submitted_at":"2026-08-06T22:34:20Z","title":"Retrofitting Linear Attention into Diffusion Language Models"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":2,"verified_fuzzy":1},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2608.06628."}