{"as_of":"2026-08-20T15:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f6af1cecd1062d31a90e1a5eaa7731f3ddedce0674c7a978ea36c488be18d96f","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:58:56.185517Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T01:44:40.722957Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T01:45:50.813321Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"cited_work":{"arxiv_id":"2506.09316","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.09316","snapshot_observed_at":"2026-07-09T01:45:50.813321Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","venue":"cs.LG","work_id":"3d670f26-8ba3-435b-8d4b-1572f224239b","year":2025},"citing_paper":{"arxiv_id":"2607.07706","last_updated":"2026-07-08T17:59:09Z","snapshot_observed_at":"2026-08-18T19:55:26.136166Z","submitted_at":"2026-07-08T17:59:09Z","title":"The Key to Going Linear: Analysis-Driven Transformer Linearization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-09T01:44:40.722957Z"},"links":{"cited_paper":"/paper/2506.09316","citing_paper":"/paper/2607.07706"},"observation_digest":"sha256:89cbebf17df0d2643b75c9f8b3548a35ef7453caf4af6759482d350d866d249f","observation_id":"a94b9bcd-0ab4-4d30-aa30-fd841611e3de","resolution":{"observed_at":"2026-07-09T01:45:50.814563Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09316/citation-record","integrity":"/paper/2506.09316/integrity","json":"/paper/2506.09316/citation-record.json","paper":"/paper/2506.09316"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:47.722470Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:47.722470Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:26de0736e2079cd8e6bab5780ad88bee7f952db50967287fc96d3917852c15fc","observation_id":"5bfda6f3-306d-41fd-931b-8187ceac2d05","resolution":{"observed_at":"2026-08-07T04:58:47.722470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:00.882021Z","title":"https://huggingface.co/blog/bamba","venue":null,"work_id":"6dcb74dd-62c8-4971-a539-4eb400d431c0","year":2025},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:47.896982Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:18d0207b49ce921af2f51d203b338c40839c5dffdc0510fc8e642c4201ad32f3","observation_id":"f13a33ab-b5eb-4658-b2f7-6f3d8873d112","resolution":{"observed_at":"2026-08-07T04:59:00.985710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:00.598931Z","title":"nvidia.com","venue":null,"work_id":"6c6cb0c4-2e65-433a-a26a-3e936d088647","year":2025},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:48.049768Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:352b064387f206c7a6741bca1325dc6aaeed82e951cbb82e861a86a9ca50bc0b","observation_id":"0b7d6472-f4b2-4a0e-a991-5a5a52832d11","resolution":{"observed_at":"2026-08-07T04:59:00.736487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:00.314038Z","title":"Y., Rajbhandari, S., Awan, A","venue":null,"work_id":"bf61408f-c232-4762-9098-bd47c0951a52","year":2022},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:48.164225Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:249d25460bb0c26e07fc40336abce6d2f57a002012824ef9594759d520dd848a","observation_id":"b283f60b-528c-487d-937c-6b79e056f232","resolution":{"observed_at":"2026-08-07T04:59:00.471006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:59.954407Z","title":"E., and Pedram, M","venue":null,"work_id":"45451b70-8d90-4e26-94d5-128500469d07","year":2025},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:48.249807Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:a7f6a4e5fc72b747c59729bef405e142f47f2e9122ad936d02e93d17e8e10e5e","observation_id":"98ce186c-6273-4abe-aaad-b75d1ef8b7a1","resolution":{"observed_at":"2026-08-07T04:59:00.081477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:48.382295Z","title":"L ong B ench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:48.382295Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:b9be1ab47aa748f952741a2aa88a936ac729f3649d552a516b5d3c8e69610517","observation_id":"5273c4d9-aed8-4fc5-9d84-7a4e9a747c66","resolution":{"observed_at":"2026-08-07T04:58:48.382295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T04:58:48.482440Z","title":"E., and Cohan, A","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:48.482440Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:a38409602dc420dfc1bf99ed99ec8691c42e1a2daeed0898f60ec64187ecd34a","observation_id":"b4b23c6f-a9c4-450c-af41-b565de419c9f","resolution":{"observed_at":"2026-08-07T04:58:48.482440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14528","last_updated":"2025-04-09T22:43:46Z","snapshot_observed_at":"2026-08-19T15:35:26.164827Z","submitted_at":"2024-06-20T17:40:18Z","title":"DeciMamba: Exploring the Length Extrapolation Potential of Mamba","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14528","snapshot_observed_at":"2026-08-07T04:58:48.617700Z","title":"Decimamba: Exploring the length extrapolation potential of mamba","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:48.617700Z"},"links":{"cited_paper":"/paper/2406.14528","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:bcdc0097264415d136818f459714326e07e49b00d62e3f8656625c00b539e226","observation_id":"3b11432c-7289-4214-a0e8-0356dc373cd5","resolution":{"observed_at":"2026-08-07T04:58:48.617700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10189","last_updated":"2025-02-08T20:53:16Z","snapshot_observed_at":"2026-08-18T18:45:02.408021Z","submitted_at":"2024-08-19T17:48:11Z","title":"Transformers to SSMs: Distilling Quadratic Knowledge to Subquadratic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10189","snapshot_observed_at":"2026-08-07T04:58:48.707551Z","title":"Y., Xing, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:48.707551Z"},"links":{"cited_paper":"/paper/2408.10189","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:a33e1789ce7271adebccbff1bde3c8f421ce053aeb0b8fb981de68138e3d1298","observation_id":"eaa20003-4262-4252-8800-37325f79b0d9","resolution":{"observed_at":"2026-08-07T04:58:48.707551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:59.679303Z","title":"Read-me: Refactorizing llms as router-decoupled mixture of experts with system co-design","venue":null,"work_id":"4e320d06-7142-4a01-a1e7-1754c79b0c97","year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:48.781558Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:19afb33c22385c56da2245e9bbaa2c0e1d9f27239ad7d2543fd1b0a0ae26c238","observation_id":"c038ba8e-116a-48c4-9d24-081a163a488a","resolution":{"observed_at":"2026-08-07T04:58:59.780840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-08-17T10:13:54.763177Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-07T04:58:48.869443Z","title":"D., Chen, D., and Dao, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:48.869443Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:b59b9c791cab7fc5cf7905da83fe6af9be6460eb11e0e68882698a375c705169","observation_id":"07d2a5a3-58fd-4863-bd67-88bfea0b78d1","resolution":{"observed_at":"2026-08-07T04:58:48.869443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-07T04:58:48.971053Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:48.971053Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:801df00e84683e6ef09d88685e18ca150dd4e410fc790ad8b769dea6960d2196","observation_id":"1c3c1ef5-6963-4f2d-be24-b2e6f1caf26a","resolution":{"observed_at":"2026-08-07T04:58:48.971053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-12T04:58:34.201421Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-08-07T04:58:49.052883Z","title":"Rethinking attention with performers","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:49.052883Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:b048236e408f16aaaa43c3506c184ebc5d66d06093394e9fc147d4c9c21d853d","observation_id":"3f981207-6675-465c-bddf-5865bbf9af51","resolution":{"observed_at":"2026-08-07T04:58:49.052883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:59.397126Z","title":"B., Bierbaum, M., O'Keeffe, K","venue":null,"work_id":"45d15823-bf60-40e5-8a34-af073f2e2be3","year":2019},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:49.197097Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:7d6b563692237f4019cc3f9f218a2c26f4622a00178b50b887d30f281ce1a202","observation_id":"caa8a0d6-4443-4244-be32-5541b466d2b0","resolution":{"observed_at":"2026-08-07T04:58:59.552638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-07T04:58:49.317548Z","title":"and Gu, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:49.317548Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:9146a7b486be5881ea133688926b550befe4a92b791e8ca349e1b57fbdc4f6e2","observation_id":"dd369b7c-a24e-4e77-9095-027a32d5b3af","resolution":{"observed_at":"2026-08-07T04:58:49.317548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-07T04:58:49.481739Z","title":"Y., Ermon, S., Rudra, A., and Ré, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:49.481739Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:c004cfd7dded41e28be40af1a2c07f86fe8093974519af80e97c17265f0f737b","observation_id":"7656668f-69cb-4452-a0d4-fd5e041f863f","resolution":{"observed_at":"2026-08-07T04:58:49.481739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17238","last_updated":"2023-12-28T18:58:13Z","snapshot_observed_at":"2026-08-19T12:48:02.319950Z","submitted_at":"2023-12-28T18:58:13Z","title":"Fast Inference of Mixture-of-Experts Language Models with Offloading","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17238","snapshot_observed_at":"2026-08-07T04:58:49.567474Z","title":"and Mazur, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:49.567474Z"},"links":{"cited_paper":"/paper/2312.17238","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:6afe8d660fe51902176afa31e7a5f993fcd9b8cd9686d4cdd4af4057d2d169b6","observation_id":"55ab2dfb-5b33-4648-897b-1a4f4fa7ad5f","resolution":{"observed_at":"2026-08-07T04:58:49.567474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:59.139903Z","title":"Stack exchange data dump, 2024","venue":null,"work_id":"60f17d6c-3cc9-4320-8a5b-f026516d05f2","year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:49.666529Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:2f83ae532a0bcfe22625cb1e9ee6f055b11f6cb9ca22b8fdf34eb36b85f5f50d","observation_id":"131ca01e-8ce2-4a38-a120-994baca3c13d","resolution":{"observed_at":"2026-08-07T04:58:59.265908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:58.930288Z","title":"Wikimedia downloads","venue":null,"work_id":"cff2b459-0588-495d-91d4-2fa4f42ef1a8","year":null},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:49.775365Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:2d436fa04bd0dbf6418b7d5dea17ec0a05411d7aabcecbdd08790dc154bfc11f","observation_id":"64f49872-e4ba-4ea9-81e7-b1f0040dceb4","resolution":{"observed_at":"2026-08-07T04:58:58.999314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:58.651764Z","title":"and Alistarh, D","venue":null,"work_id":"2b9c0e97-84c3-43a9-bd5e-684813107592","year":2023},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:49.889850Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:e789a068ddcd5ab6a497ed876fe09fa0c15442d09522ca9c5b98897d7b65466e","observation_id":"4e870e7c-e10d-49bc-a9a6-3d37f9ae665a","resolution":{"observed_at":"2026-08-07T04:58:58.788465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-16T07:57:19.216626Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-07T04:58:50.021067Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:50.021067Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:feac11ac8a4c12b82725ec25a7e2c12d1ce79a97a0722f39f7aa1dd2c1a0423b","observation_id":"9b73c7ec-2a49-4a10-abcc-e60a0b7ec9ee","resolution":{"observed_at":"2026-08-07T04:58:50.021067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T04:58:50.184312Z","title":"The P ile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:50.184312Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:f1d3ba946ed06f770880ce1431f20c2fbf1c8217bfa6c8e3f11a51f12e54e771","observation_id":"f2f1a551-1433-40be-83a9-31b56dcc05cc","resolution":{"observed_at":"2026-08-07T04:58:50.184312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16712","last_updated":"2024-05-26T22:23:02Z","snapshot_observed_at":"2026-08-18T10:18:01.875999Z","submitted_at":"2024-05-26T22:23:02Z","title":"Zamba: A Compact 7B SSM Hybrid Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16712","snapshot_observed_at":"2026-08-07T04:58:50.356463Z","title":"Zamba: A compact 7b ssm hybrid model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:50.356463Z"},"links":{"cited_paper":"/paper/2405.16712","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:c6ce09a01dc1d32a3a582785f79849e76ce2c68f2b3826de4bbc5c345ddfaab0","observation_id":"00105b00-2053-4aee-8bf6-8b37ef7c0782","resolution":{"observed_at":"2026-08-07T04:58:50.356463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-07T04:58:50.507722Z","title":"and Dao, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:50.507722Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:25db2a7b62e6cdb32359e1e981ed9bff1ee2788565a9249768a72384877e83b9","observation_id":"b572fc40-30bf-400c-89ce-597be1886fbf","resolution":{"observed_at":"2026-08-07T04:58:50.507722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:58.428279Z","title":"N V I D I A H 100 T ensor C ore G P U D atasheet --- resources.nvidia.com","venue":null,"work_id":"37a7bb0c-ae80-4a71-9f2c-150f05a482ec","year":2025},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:50.652089Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:968a1b93d5c7870f1d1a5d0d5a9594d5d9dba380b254fbd163d0e6722f516db0","observation_id":"4df2d4b4-e48d-4630-a050-d2a0ad4d3c48","resolution":{"observed_at":"2026-08-07T04:58:58.550360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:58.194689Z","title":"M., Kocisky, T., Grefenstette, E., Espeholt, L., Kay, W., Suleyman, M., and Blunsom, P","venue":null,"work_id":"b893424f-17d5-4232-811d-7e9bfda2a4e3","year":2015},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:50.783539Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:a3edc0260059a26e3a5c67b8ea4f439504fd0f9bf8e8bafd93687bad45bf4d7d","observation_id":"24fec936-f6af-457d-afa1-96c547d714c2","resolution":{"observed_at":"2026-08-07T04:58:58.326820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T04:58:50.924458Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:50.924458Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:d26a3dd6458b4385be9e2a05f05000b162b7d8a4d92e1b91cbaca52cc506e1a9","observation_id":"2af91c23-f9c4-4c00-adfb-ca5d731a8b56","resolution":{"observed_at":"2026-08-07T04:58:50.924458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:57.952760Z","title":"What does bert learn about the structure of language? In ACL 2019-57th Annual Meeting of the Association for Computational Linguistics, 2019","venue":null,"work_id":"904ad518-6fdc-4e6c-8454-c8aa11e37d24","year":2019},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:51.094449Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:c83ac48451a398e7cb75c9bcb9d86cb6c26272bcb5c06416ef2fd8ac513519fe","observation_id":"474fa1c2-123c-40e7-83e2-405f0ef97487","resolution":{"observed_at":"2026-08-07T04:58:58.092789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13076","last_updated":"2021-09-20T06:45:09Z","snapshot_observed_at":"2026-08-16T18:36:43.295670Z","submitted_at":"2021-03-24T10:50:43Z","title":"Finetuning Pretrained Transformers into RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13076","snapshot_observed_at":"2026-08-07T04:58:51.297853Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:51.297853Z"},"links":{"cited_paper":"/paper/2103.13076","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:bdc7e62e590eae19f6032b558758a5085ff6386ee429d9ef26e5de327f224e6d","observation_id":"9c07b291-0a01-4b32-97a8-91d25c9f1e2f","resolution":{"observed_at":"2026-08-07T04:58:51.297853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:51.450640Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:51.450640Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:2690f1d91bea4167cb43a411890ded1fcd1ab646a5243e59eec17b10722b2766","observation_id":"f4fd3083-54f4-497e-9cb9-71726f172800","resolution":{"observed_at":"2026-08-07T04:58:51.450640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07707","last_updated":"2024-12-15T03:45:36Z","snapshot_observed_at":"2026-08-19T16:56:44.641239Z","submitted_at":"2023-10-11T17:57:14Z","title":"MatFormer: Nested Transformer for Elastic Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07707","snapshot_observed_at":"2026-08-07T04:58:51.628661Z","title":"Matformer: Nested transformer for elastic inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:51.628661Z"},"links":{"cited_paper":"/paper/2310.07707","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:511fd7a21cb14c9aa2ba7f84bf7c70b68f3bd24c0f2dc040186bd0e14309497b","observation_id":"b7bd5cda-0fe8-4210-9584-91b6f27db0bc","resolution":{"observed_at":"2026-08-07T04:58:51.628661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:57.656277Z","title":"H., Gonzalez, J., Zhang, H., and Stoica, I","venue":null,"work_id":"0a16e58d-5d2e-4b2d-94e3-0c7e8fb9791a","year":2023},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:51.721497Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:af1ba0e1ef83d7194a273b445cbaed3cd9e163e45e7be5564d06c4d8d1c668f2","observation_id":"486207a5-8545-41c4-a53b-f6594aeacc91","resolution":{"observed_at":"2026-08-07T04:58:57.806373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-07T04:58:51.906431Z","title":"H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:51.906431Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:4a89489d2e5356af109f90be3c6151bc541bc3205abf5fec161553991a4c4f89","observation_id":"f8dbd3fc-40c9-40ed-9b15-0bc4e9df16b3","resolution":{"observed_at":"2026-08-07T04:58:51.906431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:52.096427Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:52.096427Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:7bde6dcb7d686008634438f2cbb969bdc64ab3ce11605acce995a02f333d4065","observation_id":"b52c1bab-5b63-4813-a562-1d957af6f787","resolution":{"observed_at":"2026-08-07T04:58:52.096427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05463","last_updated":"2023-09-11T14:01:45Z","snapshot_observed_at":"2026-08-02T22:47:03.212781Z","submitted_at":"2023-09-11T14:01:45Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05463","snapshot_observed_at":"2026-08-07T04:58:52.271444Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:52.271444Z"},"links":{"cited_paper":"/paper/2309.05463","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:cdd22a634bac01fb3a9f50afe237936fef205a14852d52b8f761192462541a09","observation_id":"2a74723d-51c5-4d7a-823a-b6da73242916","resolution":{"observed_at":"2026-08-07T04:58:52.271444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-14T12:21:04.886717Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-07T04:58:52.402890Z","title":"Snapkv: Llm knows what you are looking for before generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:52.402890Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:36148093c2c3968e048e9b8f3247775ec17eca0f61ce6befad7ee2f92919091b","observation_id":"bf0c30b2-e33f-4a74-b80c-251072379c79","resolution":{"observed_at":"2026-08-07T04:58:52.402890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-07T04:58:52.520878Z","title":"Jamba: A hybrid transformer-mamba language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:52.520878Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:c4a5c149a0aecf6e606712d158d9eb302fd40900c726846e70697e264e4341b2","observation_id":"ee832730-6ad7-4ea4-9774-9acec88298a3","resolution":{"observed_at":"2026-08-07T04:58:52.520878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:52.577018Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:52.577018Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:72cd3d530e01cd5a6be2ad1d875c2699d10a16253d13b81cab34324cc6a6ab79","observation_id":"0cd404f9-d719-4b20-970b-990fd9feea19","resolution":{"observed_at":"2026-08-07T04:58:52.577018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:52.659154Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:52.659154Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:669cc3deaf85bd617fe8aa7e26df9df0718b15af7663a9e0d991b3cc4106bfae","observation_id":"9eeb5ed2-3dd4-41f4-a0bd-08b52facb7b3","resolution":{"observed_at":"2026-08-07T04:58:52.659154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01509","last_updated":"2024-06-09T13:07:50Z","snapshot_observed_at":"2026-08-19T13:09:14.598428Z","submitted_at":"2024-03-03T13:14:47Z","title":"Fantastic Semantics and Where to Find Them: Investigating Which Layers of Generative LLMs Reflect Lexical Semantics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01509","snapshot_observed_at":"2026-08-07T04:58:52.744221Z","title":"Fantastic semantics and where to find them: Investigating which layers of generative llms reflect lexical semantics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:52.744221Z"},"links":{"cited_paper":"/paper/2403.01509","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:fbfad0387f39702d47e2e9affd56e77eabcd16d97345c31bf0dd843a93e5e7b7","observation_id":"02c42fcb-6b4e-4151-b79c-b91655505b04","resolution":{"observed_at":"2026-08-07T04:58:52.744221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14905","last_updated":"2024-06-27T03:53:46Z","snapshot_observed_at":"2026-08-16T14:16:07.202427Z","submitted_at":"2024-02-22T18:58:55Z","title":"MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14905","snapshot_observed_at":"2026-08-07T04:58:52.920517Z","title":"Mobilellm: Optimizing sub-billion parameter language models for on-device use cases","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:52.920517Z"},"links":{"cited_paper":"/paper/2402.14905","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:cdcf9512829dcbabc6e6197234411a37d9826f54fbdedb6ebf07474c8855f6fd","observation_id":"21557610-a2cf-4868-8bde-b8463e0986e7","resolution":{"observed_at":"2026-08-07T04:58:52.920517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T04:58:53.029160Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:53.029160Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:87192cf74d37dfe4b64028c9d2e630e1fc9bdb62a99e9d0a6609247d8a853140","observation_id":"8b5a5c8a-968c-454b-8ef8-e040a5dc07d0","resolution":{"observed_at":"2026-08-07T04:58:53.029160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:53.116479Z","title":"Llm-pruner: On the structural pruning of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:53.116479Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:37db232820569c448b8ff9dc7c2ff9acc66ecd888d732ce8acc4dee6a4f5eafe","observation_id":"22cd5a87-b673-442a-8b2d-2bf833df611b","resolution":{"observed_at":"2026-08-07T04:58:53.116479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06640","last_updated":"2024-05-10T17:59:08Z","snapshot_observed_at":"2026-08-20T11:48:08.962625Z","submitted_at":"2024-05-10T17:59:08Z","title":"Linearizing Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06640","snapshot_observed_at":"2026-08-07T04:58:53.185985Z","title":"Linearizing large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:53.185985Z"},"links":{"cited_paper":"/paper/2405.06640","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:5067df81a79e59eab3efb8d46ef0b6c5063c4e58e8d500a905c9fa5d51816e9b","observation_id":"0b665a0f-8f6e-4ac9-9596-5380efcd79bd","resolution":{"observed_at":"2026-08-07T04:58:53.185985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.08745","last_updated":"2018-08-27T09:08:18Z","snapshot_observed_at":"2026-08-14T18:36:49.421687Z","submitted_at":"2018-08-27T09:08:18Z","title":"Don't Give Me the Details, Just the Summary! Topic-Aware Convolutional Neural Networks for Extreme Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.08745","snapshot_observed_at":"2026-08-07T04:58:53.298370Z","title":"B., and Lapata, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:53.298370Z"},"links":{"cited_paper":"/paper/1808.08745","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:9ce7dbcca6f88bb7d512ba1d0aeff2ea590fcf7b01d511a732af9cc8f6948a60","observation_id":"12c7d4d8-c4d6-4ec6-afda-aebf182d97fa","resolution":{"observed_at":"2026-08-07T04:58:53.298370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:57.294174Z","title":"Splitwise: Efficient generative llm inference using phase splitting","venue":null,"work_id":"391a9965-09f6-469f-ae0d-5079cd6585dc","year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:53.393094Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:831fe64f8018f76967b58d096bd228bfbf210b6a3dc4a3ee0aa9797041e51f3a","observation_id":"f818956f-faa5-4580-8650-0a35e4044183","resolution":{"observed_at":"2026-08-07T04:58:57.439523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-08-17T17:58:38.402665Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-07T04:58:53.446107Z","title":"Rwkv: Reinventing rnns for the transformer era","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:53.446107Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:d58c59f66d197b06d7b7030da371764140bd0f8be0311364aa9cd957e5e0f508","observation_id":"1a8c189a-0b4c-4e2b-a3ff-5b961b0940fc","resolution":{"observed_at":"2026-08-07T04:58:53.446107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:53.510273Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:53.510273Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:5ecadc9d9ee799611179a275e7779bb6f1a37c851128f1f1104988d5bd6272ac","observation_id":"f69b21ac-6d7e-4951-9be5-a155f70a92a3","resolution":{"observed_at":"2026-08-07T04:58:53.510273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07522","last_updated":"2025-02-28T02:20:49Z","snapshot_observed_at":"2026-08-16T13:44:03.977685Z","submitted_at":"2024-06-11T17:50:51Z","title":"Samba: Simple Hybrid State Space Models for Efficient Unlimited Context Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07522","snapshot_observed_at":"2026-08-07T04:58:53.560687Z","title":"Samba: Simple hybrid state space models for efficient unlimited context language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:53.560687Z"},"links":{"cited_paper":"/paper/2406.07522","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:d3fdafebe6bb319b5ec1a15397379e9e911feed58658ac46bc2871f8e9439171","observation_id":"c20b2571-24fe-4f0a-8c43-4f5d0a729026","resolution":{"observed_at":"2026-08-07T04:58:53.560687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:56.994814Z","title":"Optimizing transformer inference with selective distillation: Layerwise conversion to linear attention","venue":null,"work_id":"eef670a1-32ed-4037-87d0-5f42c20e990a","year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:53.630222Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:d91e041264926baedbc07652b4a69a12e314c08f0cf85bb1c3ff6009afc4ef15","observation_id":"5667ba96-4ed2-4d78-a3d6-b58cc4f15d35","resolution":{"observed_at":"2026-08-07T04:58:57.163885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04368","last_updated":"2017-04-25T05:47:50Z","snapshot_observed_at":"2026-08-14T21:06:44.989948Z","submitted_at":"2017-04-14T07:55:19Z","title":"Get To The Point: Summarization with Pointer-Generator Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04368","snapshot_observed_at":"2026-08-07T04:58:53.681251Z","title":"J., and Manning, C","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:53.681251Z"},"links":{"cited_paper":"/paper/1704.04368","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:98d99a4fc4a3ecf63685638c48fa8ac14da12b17707b20e3b44343e58b7b6d27","observation_id":"7438f84c-e48b-4583-94ed-4f2777083c0c","resolution":{"observed_at":"2026-08-07T04:58:53.681251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10818","last_updated":"2024-05-09T13:56:06Z","snapshot_observed_at":"2026-08-19T12:32:54.420704Z","submitted_at":"2023-09-19T17:59:54Z","title":"SlimPajama-DC: Understanding Data Combinations for LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10818","snapshot_observed_at":"2026-08-07T04:58:53.782070Z","title":"Slimpajama-dc: Understanding data combinations for llm training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:53.782070Z"},"links":{"cited_paper":"/paper/2309.10818","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:d4ebe9b0341a594e9870cf899ad236ae693c4aa04f209856dfa10619bb6d6461","observation_id":"19a7c27f-c1ea-422c-aba3-76d047304e95","resolution":{"observed_at":"2026-08-07T04:58:53.782070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11912","last_updated":"2024-08-04T00:58:04Z","snapshot_observed_at":"2026-08-18T14:19:11.066807Z","submitted_at":"2024-04-18T05:25:54Z","title":"TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11912","snapshot_observed_at":"2026-08-07T04:58:53.855974Z","title":"Triforce: Lossless acceleration of long sequence generation with hierarchical speculative decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:53.855974Z"},"links":{"cited_paper":"/paper/2404.11912","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:f9f515f5f9941ef1b8956088c3b48bb98552078f39951db609f85b6ff892aa8b","observation_id":"db541a76-d744-4267-bcb4-3b42e9e53540","resolution":{"observed_at":"2026-08-07T04:58:53.855974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-08-20T04:15:03.506960Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-07T04:58:53.946901Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:53.946901Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:d815153a076e0d9c573b4c7253d2ef8baf1bd766260896f052426438af900bd0","observation_id":"c80eeb53-48e5-42f8-98f1-e8219f002748","resolution":{"observed_at":"2026-08-07T04:58:53.946901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-18T21:18:20.077927Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-07T04:58:54.032690Z","title":"Retentive network: A successor to transformer for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:54.032690Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:a6f4d7405ae8caae3cc6969a2e08a64905742d7e876616cf647a91026ff3dced","observation_id":"4f864534-554c-49e0-b005-f2559d13cd72","resolution":{"observed_at":"2026-08-07T04:58:54.032690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-08-19T19:59:53.494904Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-07T04:58:54.106435Z","title":"Quest: Query-aware sparsity for efficient long-context llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:54.106435Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:b8b43c9241ea3ba7d87cceb6cb5b64bc07e02807dadcdb1a019d760fee6d9d5f","observation_id":"5ebb6325-398b-4bcd-8eb1-b762d92e1674","resolution":{"observed_at":"2026-08-07T04:58:54.106435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T04:58:54.198656Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:54.198656Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:cd767bcc6a3189da41b9ab5504e94c2c1df2c2f7ec07298d068e388017884584","observation_id":"cb530a10-3b22-4f0c-9a4e-a4d1d398d34d","resolution":{"observed_at":"2026-08-07T04:58:54.198656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:54.287461Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:54.287461Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:2e9c6ad3606c124841737e8bbabd70b1b54fcc43034d5e34ebf14bf20327202d","observation_id":"9eae3fa5-0e4f-4652-baa6-55672d7c2c02","resolution":{"observed_at":"2026-08-07T04:58:54.287461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07887","snapshot_observed_at":"2026-08-07T04:58:54.362778Z","title":"An empirical study of mamba-based language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:54.362778Z"},"links":{"cited_paper":"/paper/2406.07887","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:ed497782e59c0ca31a656e0ecaecc49a5e61084024472588a2aa074c115c55be","observation_id":"4bd7ea9a-c26c-40db-974c-73cf8af22a5c","resolution":{"observed_at":"2026-08-07T04:58:54.362778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-08-16T09:50:11.319379Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-07T04:58:54.442743Z","title":"Glue: A multi-task benchmark and analysis platform for natural language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:54.442743Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:061e906b12b2c89e40433388e7240e408d560631e3ce93b19e9fc4b5707bfdbc","observation_id":"fd2e9bb5-50df-4e33-b77f-02ae198cc928","resolution":{"observed_at":"2026-08-07T04:58:54.442743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15237","last_updated":"2025-06-27T07:54:57Z","snapshot_observed_at":"2026-08-16T13:23:25.041410Z","submitted_at":"2024-08-27T17:56:11Z","title":"The Mamba in the Llama: Distilling and Accelerating Hybrid Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15237","snapshot_observed_at":"2026-08-07T04:58:54.509957Z","title":"M., and Dao, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:54.509957Z"},"links":{"cited_paper":"/paper/2408.15237","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:e5fdca38f9832f96e800d4cad1fdf78ae94f2e99f3b7af2e01b0ad667182e7c7","observation_id":"c37d3d81-be26-491d-8cf4-c007a1195ab3","resolution":{"observed_at":"2026-08-07T04:58:54.509957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00658","last_updated":"2025-03-11T03:58:57Z","snapshot_observed_at":"2026-08-18T15:47:46.321354Z","submitted_at":"2024-12-31T22:06:39Z","title":"Understanding and Mitigating Bottlenecks of State Space Models through the Lens of Recency and Over-smoothing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00658","snapshot_observed_at":"2026-08-07T04:58:54.578841Z","title":"Understanding and mitigating bottlenecks of state space models through the lens of recency and over-smoothing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:54.578841Z"},"links":{"cited_paper":"/paper/2501.00658","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:7cc060ac71d988b9e54fdd14afc23c4b94cea241951685465758e6f74935e93e","observation_id":"78136a9d-755a-4e54-a2d9-3a851978ff3c","resolution":{"observed_at":"2026-08-07T04:58:54.578841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-07T04:58:54.669694Z","title":"Z., Khabsa, M., Fang, H., and Ma, H","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:54.669694Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:f91ba9322b71f18bdf2c8fdc63c725313c466b3bddbd63daadfcda47abb7ea32","observation_id":"ac56f147-bab8-4dec-8882-d00e29c9e3ba","resolution":{"observed_at":"2026-08-07T04:58:54.669694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:54.748448Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:54.748448Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:fc6982397a7c287b31e5f6ca957e0a54ee03fe358eac9abd39474d8d19ae6f91","observation_id":"bd53dc6b-d00c-4058-bedf-aa578be4126f","resolution":{"observed_at":"2026-08-07T04:58:54.748448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-20T09:03:18.402041Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T04:58:54.815383Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:54.815383Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:ac27a3c0063127c2893e648234675753e7249464f0de2b98386a096182f86018","observation_id":"f53d8580-e9a3-47d3-8a15-896ccef73530","resolution":{"observed_at":"2026-08-07T04:58:54.815383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-08-17T21:47:46.144942Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-07T04:58:54.918582Z","title":"Gated linear attention transformers with hardware-efficient training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:54.918582Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:8fdf7a8bf0356641982f46266319f6adb7d7838aa2cd9c9e5fc87558428e107a","observation_id":"508c89cd-b939-4ffb-8522-a5a5eb53a68b","resolution":{"observed_at":"2026-08-07T04:58:54.918582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01005","last_updated":"2025-04-21T20:10:11Z","snapshot_observed_at":"2026-07-06T20:15:36.280948Z","submitted_at":"2025-01-02T02:02:20Z","title":"FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01005","snapshot_observed_at":"2026-08-07T04:58:55.007481Z","title":"Flashinfer: Efficient and customizable attention engine for llm inference serving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:55.007481Z"},"links":{"cited_paper":"/paper/2501.01005","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:46daefa267ee89be62c65d2691b3b9a289a3d0b6c3d3c07058afa049472aba1a","observation_id":"f5a99ef4-a68c-4e5d-a02a-a37257d44035","resolution":{"observed_at":"2026-08-07T04:58:55.007481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:56.890237Z","title":"S., Kim, G.-W., Kim, S., and Chun, B.-G","venue":null,"work_id":"34fb3fc4-9392-4d88-ad43-f1d6ee1cd1cc","year":2022},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:55.141581Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:93c939bc283b52daa038c74a051326f5370467069d92806a63624de7528b104a","observation_id":"806fe173-a090-432d-bc7b-b63718448c40","resolution":{"observed_at":"2026-08-07T04:58:56.922471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:55.348157Z","title":"A., Ainslie, J., Alberti, C., Ontanon, S., Pham, P., Ravula, A., Wang, Q., Yang, L., et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:55.348157Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:872dedb5a67a84d42682bf07814c2206ef8a452d1168985bbf3e8fc40d3e2ca5","observation_id":"9ffaab65-25e7-401b-b739-253b974d5ed5","resolution":{"observed_at":"2026-08-07T04:58:55.348157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10254","last_updated":"2025-03-05T21:57:04Z","snapshot_observed_at":"2026-08-16T14:09:15.511506Z","submitted_at":"2024-10-14T08:10:34Z","title":"LoLCATs: On Low-Rank Linearizing of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10254","snapshot_observed_at":"2026-08-07T04:58:55.594059Z","title":"Lolcats: On low-rank linearizing of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:55.594059Z"},"links":{"cited_paper":"/paper/2410.10254","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:ab91aade490a2800fa54be29cf256d5ee46d8d6f76148cc46d91f5542b844189","observation_id":"5c2ba22a-125f-4c20-b045-c6e43cb22b8f","resolution":{"observed_at":"2026-08-07T04:58:55.594059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04347","last_updated":"2024-02-06T19:31:26Z","snapshot_observed_at":"2026-08-16T14:20:52.366502Z","submitted_at":"2024-02-06T19:31:26Z","title":"The Hedgehog & the Porcupine: Expressive Linear Attentions with Softmax Mimicry","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04347","snapshot_observed_at":"2026-08-07T04:58:55.827537Z","title":"The hedgehog & the porcupine: Expressive linear attentions with softmax mimicry","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:55.827537Z"},"links":{"cited_paper":"/paper/2402.04347","citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:f2bd2139e778b36b4568a4b2f58c5e8853c6913b2760b95765aa1cc45256ebc3","observation_id":"09d1b7ac-3019-4ad9-81a3-0dd013c889d8","resolution":{"observed_at":"2026-08-07T04:58:55.827537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:56.004667Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:56.004667Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:0f501ca96eb2659f5ed9a19a4758981bfb35e0a56bd20ffb000abff923aca361","observation_id":"397da5de-50cc-4ae0-8606-ec5277bca783","resolution":{"observed_at":"2026-08-07T04:58:56.004667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:56.185517Z","title":"P., Zhang, H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T04:58:56.185517Z"},"links":{"citing_paper":"/paper/2506.09316"},"observation_digest":"sha256:aa8dc6c219c9da4fd9d3ae4f4cfa25b539797d1fc1ac3688ad1d14537f7fb75e","observation_id":"05c3c4a2-b8a6-463f-aa81-d4c5e9be40ae","resolution":{"observed_at":"2026-08-07T04:58:56.185517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.09316","last_updated":"2025-06-17T04:56:46Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T11:02:36.129585Z","submitted_at":"2025-06-11T01:25:06Z","title":"On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 1 inbound Pith citation observation for arXiv:2506.09316."}