{"as_of":"2026-08-20T10:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b6d9bd723c9d7bcfd03e61eac71cef33e0b8dbe9e362790bc5eabac6c173f64","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T21:20:37.610849Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2511.15927/citation-record","integrity":"/paper/2511.15927/integrity","json":"/paper/2511.15927/citation-record.json","paper":"/paper/2511.15927"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T21:20:33.721967Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:33.721967Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:25bab858b92aa84272606d1397e5f7117c1b9981d45fcaeb6803e9cf4c637843","observation_id":"22317898-47e0-41dd-8365-959ec39cff38","resolution":{"observed_at":"2026-08-03T21:20:33.721967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:20:37.610849Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:37.610849Z"},"links":{"citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:dbb2ff61d70a6eaddd0ffd60767e59deb8ab5ce1e35aff9f528d70b9f7e68613","observation_id":"f8818d1a-f148-49c9-ac88-dcd017b4916b","resolution":{"observed_at":"2026-08-03T21:20:37.610849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:20:34.255170Z","title":"A cheaper and better diffusion language model with soft-masked noise","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:34.255170Z"},"links":{"citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:751aee3800f18ac3f7b80bda09d4d022bb86f1600f2ee66ba3740ce032f053da","observation_id":"b55a9ebb-52b9-4379-b24d-845383d44715","resolution":{"observed_at":"2026-08-03T21:20:34.255170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-03T21:20:34.318430Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:34.318430Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:a88202a3b5c2e3b448b9af4412ae8f66ab8090b799f4a9f82b85e67fc3f4df60","observation_id":"2e408d14-baf8-453f-bbc8-05971c5312be","resolution":{"observed_at":"2026-08-03T21:20:34.318430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-03T21:20:34.467266Z","title":"Griffin: Mix- ing gated linear recurrences with local attention for efficient language models.arXiv preprint arXiv:2402.19427,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:34.467266Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:2247db52b2037cea559b6caff99983e7da2d829839aef86297e8aeaab5294cd6","observation_id":"60ec5ed0-64e6-4810-b69a-d0a5625e074e","resolution":{"observed_at":"2026-08-03T21:20:34.467266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-03T21:20:34.561539Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:34.561539Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:605fea8b665f9e0e0f201857703982aba56b622cca5c342acb5ac5333ebca454","observation_id":"7a578d28-e2f5-4437-a423-68607535e08e","resolution":{"observed_at":"2026-08-03T21:20:34.561539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-03T21:20:34.645253Z","title":"Training compute-optimal large language models.arXiv preprint arXiv:2203.15556,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:34.645253Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:69cbce4d261aecfa1beb26d83811725db86063867b4eb170a522d74824baed40","observation_id":"8c66ecec-820b-48ea-9b75-fc94c6817ef9","resolution":{"observed_at":"2026-08-03T21:20:34.645253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05667","last_updated":"2024-05-09T10:41:18Z","snapshot_observed_at":"2026-08-19T13:21:19.070618Z","submitted_at":"2024-05-09T10:41:18Z","title":"VM-DDPM: Vision Mamba Diffusion for Medical Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05667","snapshot_observed_at":"2026-08-03T21:20:34.761212Z","title":"Vm-ddpm: Vision mamba diffusion for medical image synthesis.arXiv preprint arXiv:2405.05667,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:34.761212Z"},"links":{"cited_paper":"/paper/2405.05667","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:9f633cfe4d86879cd28cc2dba5d40aa02ae80e33625a9f9a006d7068a62965df","observation_id":"c4e7e634-43cc-45bd-96cd-b6581796ebbe","resolution":{"observed_at":"2026-08-03T21:20:34.761212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17298","last_updated":"2025-06-17T17:06:18Z","snapshot_observed_at":"2026-08-16T00:24:16.429058Z","submitted_at":"2025-06-17T17:06:18Z","title":"Mercury: Ultra-Fast Language Models Based on Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17298","snapshot_observed_at":"2026-08-03T21:20:34.887984Z","title":"Mercury: Ultra-fast language models based on diffusion.arXiv preprint arXiv:2506.17298,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:34.887984Z"},"links":{"cited_paper":"/paper/2506.17298","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:4ea06678de870acc311ea1b64367860a51da4787853f802ff10ab22f26854c68","observation_id":"2a094343-faed-4989-9198-906a3f79bce5","resolution":{"observed_at":"2026-08-03T21:20:34.887984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:20:35.051086Z","title":"Diffuspec: Unlocking diffusion language models for speculative decoding.arXiv preprint arXiv:2510.02358, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:35.051086Z"},"links":{"citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:f795a91aae2b1532dc136785f161dc5ce63178f995776dad4e2703764f95e19a","observation_id":"ae2c70c2-3910-4598-9592-f0f2e8a40436","resolution":{"observed_at":"2026-08-03T21:20:35.051086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10875","last_updated":"2026-06-04T15:16:30Z","snapshot_observed_at":"2026-08-17T15:24:08.119769Z","submitted_at":"2025-08-14T17:47:22Z","title":"A Survey on Diffusion Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10875","snapshot_observed_at":"2026-08-03T21:20:35.167864Z","title":"A survey on diffusion language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:35.167864Z"},"links":{"cited_paper":"/paper/2508.10875","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:a1f4a0b86e2dd9a252c0d62d3cb96325f129a11c163c69196abf838bc5d2df70","observation_id":"fd424eaa-f268-4133-8067-c20c5ba218d0","resolution":{"observed_at":"2026-08-03T21:20:35.167864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-08-18T19:00:40.885312Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-08-03T21:20:35.291038Z","title":"Logiqa: A challenge dataset for machine reading comprehension with logical reasoning.arXiv preprint arXiv:2007.08124,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:35.291038Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:9cd4aed89ca54b908c7d55df2de46995052638655efe8aa27cd2f1e318c276f8","observation_id":"f552320c-69fe-4cd5-b1ca-d8166ed47a8a","resolution":{"observed_at":"2026-08-03T21:20:35.291038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:20:35.383719Z","title":"Vision mamba: A comprehensive survey and taxonomy.IEEE Transactions on Neural Networks and Learning Systems, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:35.383719Z"},"links":{"citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:6d8b366d991d0073bcbc2d17062517a456ae21e090e7061878fda56e28ee7a02","observation_id":"f539f8b9-e2d9-4bc2-87d0-6fcbff0a5d20","resolution":{"observed_at":"2026-08-03T21:20:35.383719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15781","last_updated":"2025-05-21T17:32:10Z","snapshot_observed_at":"2026-08-11T13:17:41.186341Z","submitted_at":"2025-05-21T17:32:10Z","title":"dKV-Cache: The Cache for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15781","snapshot_observed_at":"2026-08-03T21:20:35.469650Z","title":"dkv-cache: The cache for diffusion language models.arXiv preprint arXiv:2505.15781,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:35.469650Z"},"links":{"cited_paper":"/paper/2505.15781","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:204130dcca936fdf93f94bf118cd9218cf1e68740194c84fa6efc12d2096d6eb","observation_id":"9493dd07-a51c-4254-85f7-ecb47e6eecdb","resolution":{"observed_at":"2026-08-03T21:20:35.469650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:20:35.620610Z","title":"Training optimal large diffusion language models.arXiv preprint arXiv:2510.03280,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:35.620610Z"},"links":{"citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:027958b09d4fbbd30542d3020c7fb19b109b4d93b6100ae3389a3233848e9392","observation_id":"c2604ad3-2ba4-4eea-b05f-36ff83f289fc","resolution":{"observed_at":"2026-08-03T21:20:35.620610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-03T21:20:35.779755Z","title":"Large language diffusion models.arXiv preprint arXiv:2502.09992,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:35.779755Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:d7decf08031af4cc222baac74ed69d510ff9060a82345081ad52a3bd3c689bbe","observation_id":"32c90c32-673a-41a9-a16e-9c853dd149b7","resolution":{"observed_at":"2026-08-03T21:20:35.779755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:20:35.960149Z","title":"Apriel-h1: Towards efficient enterprise reasoning models.arXiv preprint arXiv:2511.02651,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:35.960149Z"},"links":{"citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:7cf7b9d96fdb8ded91ad5a7b4af05d61838ceeadaca8af2f53eae3790feae88e","observation_id":"0decc5a1-c83f-4c57-80af-b3b71b18ae9d","resolution":{"observed_at":"2026-08-03T21:20:35.960149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03736","last_updated":"2026-03-23T09:46:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T04:22:11Z","title":"Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03736","snapshot_observed_at":"2026-08-03T21:20:36.123584Z","title":"Your absorbing discrete diffusion secretly models the conditional distributions of clean data.arXiv preprint arXiv:2406.03736,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:36.123584Z"},"links":{"cited_paper":"/paper/2406.03736","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:bb191d55ef63a2e197fa2231c6bb0cc4a28fb54187fe0bec30e0445d2d70dc46","observation_id":"f2b419b7-c859-4e1e-8197-cd1cc952b0b8","resolution":{"observed_at":"2026-08-03T21:20:36.123584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:20:36.274592Z","title":"How efficient are diffusion language models? a critical examination of efficiency evaluation practices.arXiv preprint arXiv:2510.18480,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:36.274592Z"},"links":{"citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:9a469a6f7c4347ce21636d8e00a363fa52349a8a19197e5512a15a0994b92977","observation_id":"7f0cecbb-2d18-4a71-81d6-0c269c73e31a","resolution":{"observed_at":"2026-08-03T21:20:36.274592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18970","last_updated":"2026-08-10T17:25:54Z","snapshot_observed_at":"2026-08-13T23:48:35.423924Z","submitted_at":"2025-03-22T01:55:32Z","title":"Advancing Intelligent Sequence Modeling: Evolution, Trade-offs, and Applications of State-Space Architectures from S4 to Mamba","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18970","snapshot_observed_at":"2026-08-03T21:20:36.531085Z","title":"From s4 to mamba: A comprehensive survey on structured state space models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:36.531085Z"},"links":{"cited_paper":"/paper/2503.18970","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:63306fd18cfafd14682e09ee057df8a787a9b2f06d995099aaa66a7d581730a1","observation_id":"b207ab99-40e1-4900-99ba-4c57fc9ef63f","resolution":{"observed_at":"2026-08-03T21:20:36.531085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14224","last_updated":"2024-07-10T09:02:11Z","snapshot_observed_at":"2026-08-16T20:38:15.729152Z","submitted_at":"2024-05-23T06:53:18Z","title":"DiM: Diffusion Mamba for Efficient High-Resolution Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14224","snapshot_observed_at":"2026-08-03T21:20:36.640298Z","title":"Dim: Diffusion mamba for efficient high-resolution image synthesis.arXiv preprint arXiv:2405.14224,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:36.640298Z"},"links":{"cited_paper":"/paper/2405.14224","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:88c2b8deeb8c7082d3455f64c1b89d6cdd362eba3f524bd07634f41228439083","observation_id":"1e262035-57f1-48ea-b82c-5c7f0c92e345","resolution":{"observed_at":"2026-08-03T21:20:36.640298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-03T21:20:36.711613Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:36.711613Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:0f645b4c2263bedb443760626b4277255a2ddda6e2e29dc7d0a1dd673c445635","observation_id":"048ae446-3460-4335-ad18-06fba1f5b319","resolution":{"observed_at":"2026-08-03T21:20:36.711613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06457","last_updated":"2026-06-24T00:07:31Z","snapshot_observed_at":"2026-08-14T00:11:56.379317Z","submitted_at":"2025-07-08T23:54:11Z","title":"A Systematic Analysis of Hybrid Linear Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06457","snapshot_observed_at":"2026-08-03T21:20:36.774366Z","title":"A systematic analysis of hybrid linear attention.arXiv preprint arXiv:2507.06457, 2025a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:36.774366Z"},"links":{"cited_paper":"/paper/2507.06457","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:b40b9497d461e6c705c92fb156921244a53a0474565770bbb20db97c35a21315","observation_id":"ed9f442b-1837-4e9d-a88d-69973043bd51","resolution":{"observed_at":"2026-08-03T21:20:36.774366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09192","last_updated":"2025-08-08T04:51:37Z","snapshot_observed_at":"2026-08-13T05:22:59.274069Z","submitted_at":"2025-08-08T04:51:37Z","title":"Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09192","snapshot_observed_at":"2026-08-03T21:20:36.811629Z","title":"Diffusion llms can do faster-than-ar inference via discrete diffusion forcing.arXiv preprint arXiv:2508.09192, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:36.811629Z"},"links":{"cited_paper":"/paper/2508.09192","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:8be55b56515d7948d226856d9b30557d0d54c3e0ceb08ee49c4f39dc369a0386","observation_id":"d0a8dbb5-30af-44c2-943a-fb7e41d63bb7","resolution":{"observed_at":"2026-08-03T21:20:36.811629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18861","last_updated":"2024-11-10T15:06:53Z","snapshot_observed_at":"2026-08-18T18:58:36.330394Z","submitted_at":"2024-04-29T16:51:30Z","title":"Visual Mamba: A Survey and New Outlooks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18861","snapshot_observed_at":"2026-08-03T21:20:36.912809Z","title":"Visual mamba: A survey and new outlooks.arXiv preprint arXiv:2404.18861,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:36.912809Z"},"links":{"cited_paper":"/paper/2404.18861","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:08c86ab364d7bf96ad3e003cda661312f03ffdadeb54966575f134b10b1f6e5e","observation_id":"638a541f-5b88-4673-8151-edb334bea874","resolution":{"observed_at":"2026-08-03T21:20:36.912809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06464","last_updated":"2025-03-06T06:57:34Z","snapshot_observed_at":"2026-08-14T21:08:22.323819Z","submitted_at":"2024-12-09T13:09:04Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06464","snapshot_observed_at":"2026-08-03T21:20:37.083516Z","title":"Gated delta networks: Improving mamba2 with delta rule.arXiv preprint arXiv:2412.06464,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:37.083516Z"},"links":{"cited_paper":"/paper/2412.06464","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:dc0af56a9ce1e006623ab9645fbaeabb7b246504db33391835d724e587e46ea0","observation_id":"82f75f09-ef89-4a53-893b-5fd898c9cf55","resolution":{"observed_at":"2026-08-03T21:20:37.083516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15487","last_updated":"2025-08-21T12:09:58Z","snapshot_observed_at":"2026-08-14T18:38:02.862463Z","submitted_at":"2025-08-21T12:09:58Z","title":"Dream 7B: Diffusion Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15487","snapshot_observed_at":"2026-08-03T21:20:37.240159Z","title":"Dream 7b: Diffusion large language models.arXiv preprint arXiv:2508.15487,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:37.240159Z"},"links":{"cited_paper":"/paper/2508.15487","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:1748e9d4009926237cb853f28f6df19b10cabe7315e83436245741b0ccc57850","observation_id":"a90c127d-1911-459b-a98f-745e09f3a48c","resolution":{"observed_at":"2026-08-03T21:20:37.240159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19223","last_updated":"2025-10-12T15:42:47Z","snapshot_observed_at":"2026-08-09T15:57:47.133628Z","submitted_at":"2025-05-25T16:36:20Z","title":"LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19223","snapshot_observed_at":"2026-08-03T21:20:37.466929Z","title":"Llada 1.5: Variance-reduced preference optimization for large language diffusion models.arXiv preprint arXiv:2505.19223,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:37.466929Z"},"links":{"cited_paper":"/paper/2505.19223","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:5a303eaa4e113c9e73220f381699355f78189a35f2d151d07898d09fe572e447","observation_id":"aafa9204-ce67-4991-a974-153511cb7e89","resolution":{"observed_at":"2026-08-03T21:20:37.466929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22448","snapshot_observed_at":"2026-08-03T21:20:37.542843Z","title":"Falcon-h1: A family of hybrid-head language models redefining efficiency and performance.arXiv preprint arXiv:2507.22448,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:37.542843Z"},"links":{"cited_paper":"/paper/2507.22448","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:c9e340a665330b257c669a41c714b1a2ee7fee02331e9e4e8f7f85cbbe62b75e","observation_id":"73d6e007-626c-440c-acd8-ba40846cb89f","resolution":{"observed_at":"2026-08-03T21:20:37.542843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-13T22:06:45.477681Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-03T21:20:34.201020Z","title":"Minimax-m1: Scaling test-time compute efficiently with lightning attention.arXiv preprint arXiv:2506.13585,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:34.201020Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:730f5585d745e38a958d6f8c4ab9a0de11c6d60df0b27faaef1ca94d0ef692f4","observation_id":"49ab84e1-f9a9-48b3-bb11-c090793019c2","resolution":{"observed_at":"2026-08-03T21:20:34.201020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-03T21:20:37.375152Z","title":"A survey on efficient inference for large language models.arXiv preprint arXiv:2404.14294,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:37.375152Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:13fc969388039835540f6a7de2e77bfb9ba131719d38b7fa389a2ba98e99ce56","observation_id":"f55e4474-e844-4ab9-a3af-122a7c9e88e3","resolution":{"observed_at":"2026-08-03T21:20:37.375152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:20:35.535953Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:35.535953Z"},"links":{"citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:10d1efaa30bfbfbfaac0d2cbb6be1341a4b89969fb1c7c2c742074d9aeaeead1","observation_id":"b264eec3-3e32-4134-83dd-6b7cbe322aac","resolution":{"observed_at":"2026-08-03T21:20:35.535953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10948","last_updated":"2025-08-13T17:43:43Z","snapshot_observed_at":"2026-08-18T01:41:19.053467Z","submitted_at":"2025-08-13T17:43:43Z","title":"Apriel-Nemotron-15B-Thinker","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10948","snapshot_observed_at":"2026-08-03T21:20:36.399591Z","title":"Apriel-nemotron- 15b-thinker.arXiv preprint arXiv:2508.10948, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:36.399591Z"},"links":{"cited_paper":"/paper/2508.10948","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:703c653739ec72942d6bca08f6d49a67520a961530a500dd697c185feec23ce1","observation_id":"df51371e-5463-4ffc-ab33-7e64f68ea5e1","resolution":{"observed_at":"2026-08-03T21:20:36.399591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:20:34.132808Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:34.132808Z"},"links":{"citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:674e5eab28e1d37b2e177d528627d7e1568dfd2ae1090d3a5be80a18bf9f4dae","observation_id":"4522996c-1fbb-44a4-a21b-2df230a32157","resolution":{"observed_at":"2026-08-03T21:20:34.132808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04800","last_updated":"2026-04-21T13:16:20Z","snapshot_observed_at":"2026-08-12T17:48:16.385812Z","submitted_at":"2025-10-06T13:30:07Z","title":"Hybrid Architectures for Language Models: Systematic Analysis and Design Insights","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04800","snapshot_observed_at":"2026-08-03T21:20:33.878474Z","title":"Hybrid architectures for language models: Systematic analysis and design insights.arXiv preprint arXiv:2510.04800,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:33.878474Z"},"links":{"cited_paper":"/paper/2510.04800","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:b6f8d25d8d1b95b2a9ffbb1c9a637901f1ed74da7fb4d468b20fcda674acd287","observation_id":"636db738-0b7c-44ba-9722-bca5c55ea702","resolution":{"observed_at":"2026-08-03T21:20:33.878474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09573","last_updated":"2025-05-17T21:15:02Z","snapshot_observed_at":"2026-08-14T13:55:40.999046Z","submitted_at":"2025-03-12T17:43:40Z","title":"Block Diffusion: Interpolating Between Autoregressive and Diffusion Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09573","snapshot_observed_at":"2026-08-03T21:20:33.808196Z","title":"Block diffusion: Interpolating between autoregres- sive and diffusion language models.arXiv preprint arXiv:2503.09573,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:33.808196Z"},"links":{"cited_paper":"/paper/2503.09573","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:848303540efa2ded7e74d8b992dc7175d0cc84b8ac27934017521a02e485b000","observation_id":"b4e52c14-eac5-4589-bf70-347d103e50d8","resolution":{"observed_at":"2026-08-03T21:20:33.808196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-03T21:20:34.394984Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality.arXiv preprint arXiv:2405.21060,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:34.394984Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:c57bb4df8b90e670b8e2abeaca7f67c1c814ec6be270ff611d41e41777f9808c","observation_id":"4b7bc6fb-b3be-4da7-8518-64ab6496c972","resolution":{"observed_at":"2026-08-03T21:20:34.394984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-17T02:31:17.392838Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17679","snapshot_observed_at":"2026-08-03T21:20:34.027247Z","title":"Characterizing the behavior of training mamba-based state space models on gpus.arXiv preprint arXiv:2508.17679,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:34.027247Z"},"links":{"cited_paper":"/paper/2508.17679","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:cab7ebeee6168ec95aa0af1f01417c3773a04a0caa80085582075b902bd8bfd1","observation_id":"5b5e4834-e7fa-4450-b62d-2122592db34c","resolution":{"observed_at":"2026-08-03T21:20:34.027247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2511.15927."}