{"as_of":"2026-08-19T11:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:08d4da9d6c7061ab14351299b288195748e63be51ab12f757533d21307520fba","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:02:06.937137Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09468/citation-record","integrity":"/paper/2608.09468/integrity","json":"/paper/2608.09468/citation-record.json","paper":"/paper/2608.09468"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.651371Z","title":"Attention is all you need.Proceedings of the 2017 Advances in Neural Information Processing Systems, NeuraIPS, pages 5998–6008, 2017","venue":null,"work_id":"c216432a-74bb-4710-b6da-c96589884a1f","year":2017},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.733397Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:e8036bc8b1e120397c20ad67ed2ad89100e217857b1859b5582b4f1bf2d1cc37","observation_id":"7bd4a140-c4f3-4aca-8f13-fe8cf5344647","resolution":{"observed_at":"2026-08-11T17:02:07.657671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T17:02:06.739145Z","title":"Llama: open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.739145Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:e10746e961b5e5c60c590de154552dec9d434fb26b7a92049946f288c791262f","observation_id":"2a19aaee-0952-4df1-9c0a-856f4aa08113","resolution":{"observed_at":"2026-08-11T17:02:06.739145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T17:02:06.744470Z","title":"Llama 2: open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.744470Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:6a024c92ba20e0f54c28c626a33b9934f8ef346187f8893010653d6eb530c1e7","observation_id":"f1eba3b0-f82b-450e-84bb-51e0e2505169","resolution":{"observed_at":"2026-08-11T17:02:06.744470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:06.749457Z","title":"The llama 3 herd of models.arXiv e-prints, pages arXiv–2407, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.749457Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:3d89987072710c68b88a4bae0078bfc1587f09a2c96fb89f8ad86c39ff17e1b8","observation_id":"0fb668da-41b8-48ee-9f55-4115ea066474","resolution":{"observed_at":"2026-08-11T17:02:06.749457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.625879Z","title":"Molmo and pixmo: open weights and open data for state-of-the-art multimodal models.arXiv e-prints, pages arXiv–2409, 2024","venue":null,"work_id":"fd136ed2-a255-4dbd-afa3-5d78f273237b","year":2024},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.755293Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:460b22c661221772990af1ac4a75f08a6d18e619039e532424d9370684940081","observation_id":"77a00a8d-2fa9-42c1-81bf-23e2aa35a402","resolution":{"observed_at":"2026-08-11T17:02:07.630860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-08-18T03:47:41.144311Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-11T17:02:06.760415Z","title":"Nvlm: open frontier-class multimodal llms.arXiv preprint arXiv:2409.11402, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.760415Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:86bb49f18524960366369faaa7754dd0a4bbf631ff4e9a050d3ed720480a2fd9","observation_id":"6a6a3153-d04c-4a01-aef2-f61433ec6a6b","resolution":{"observed_at":"2026-08-11T17:02:06.760415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.609978Z","title":"Efficient transformers: a survey.ACM Computing Survey, 55(6), 2022","venue":null,"work_id":"8a3cbe22-3b08-4fde-82db-7f2716824d47","year":2022},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.767004Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:835187fed10b85528630de1c0348841b8a6c2148884fa71929d1d3efc1608ffb","observation_id":"c4a816df-d03b-4ba8-8028-3b5009247283","resolution":{"observed_at":"2026-08-11T17:02:07.615287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.593019Z","title":"A survey on efficient training of transformers","venue":null,"work_id":"ed3fc028-5cf7-4914-99da-b0f147813485","year":2023},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.772520Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:4232107978429e34d4db40c109a40cca73b17f4d877404e817577c06fdac4c8a","observation_id":"2f607eb3-f53f-4eee-b132-8c578e47b8de","resolution":{"observed_at":"2026-08-11T17:02:07.598109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.576746Z","title":null,"venue":null,"work_id":"da4045c3-7b97-43c3-af3d-5d79d28da683","year":2024},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.777736Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:7c6b492e5679dab9ac1a607e21542e104a7329359d205b2293e5f187320efc96","observation_id":"e1c29fcc-6bc8-4563-a0c0-8ef0102c0970","resolution":{"observed_at":"2026-08-11T17:02:07.581779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.561426Z","title":"A survey on vision transformer.IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(1):87–110, 2022","venue":null,"work_id":"573f0136-b981-4e18-9bd3-72edd9301cbb","year":2022},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.783024Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:38b9d54c1f28444f91610835a5187c92d0197488f8978c276423f54a4fa785b2","observation_id":"1eb31702-f9b0-4ebf-b0f6-2acd135bf81d","resolution":{"observed_at":"2026-08-11T17:02:07.566504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.546206Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":"656c46bc-e51e-474f-813c-fff9f261aafc","year":2022},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.789114Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:ff654056c1bfca5aaac8a513e80e6e9708912c6f488ffc13ceb704f64d87cf3a","observation_id":"1df62038-dde7-43b7-b1fb-94f733cdd8a7","resolution":{"observed_at":"2026-08-11T17:02:07.551246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.529384Z","title":"Diagonal state spaces are as effective as structured state spaces","venue":null,"work_id":"1e5bf0d3-b6b0-4676-b63d-947ee98193e5","year":2022},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.794479Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:251b298f5e89300e74a1785487e932c4853a075607fb3bc1d7fa6357af86903c","observation_id":"dfa9049a-e736-42ae-b409-4e28161aa6c2","resolution":{"observed_at":"2026-08-11T17:02:07.534221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.514214Z","title":null,"venue":null,"work_id":"84c898a1-16d8-4c56-8e68-af7c8168b0a4","year":2021},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.799632Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:dc363cb94d5021ff18dbeef11476f953b3947c972ebd10e16986144c212b09f1","observation_id":"5a49165a-d784-4664-b347-f09b3875177e","resolution":{"observed_at":"2026-08-11T17:02:07.519106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.498701Z","title":"Liquid structural state-space models","venue":null,"work_id":"9704d44f-8293-41ed-adfa-9045bdcb7e3a","year":2023},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.804447Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:19719b4e5c255ba10e0d50559978946fc983211d1d1db0098f1751cf39b2f962","observation_id":"fedf7564-1b39-4c14-a9b6-39fad529bd22","resolution":{"observed_at":"2026-08-11T17:02:07.503407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.483470Z","title":"Simplified state space layers for sequence modeling","venue":null,"work_id":"121ec147-1713-41f3-835c-412bf44ddd43","year":2023},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.809142Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:cb30e7b2a012d4068c591cfe3441e80af351f0d9e316f345c573fe6535694a1f","observation_id":"7484d9bd-91c1-4cbc-97c9-821d3219d5db","resolution":{"observed_at":"2026-08-11T17:02:07.488124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-18T21:18:20.077927Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-11T17:02:06.813888Z","title":"Retentive network: a successor to transformer for large language models.arXiv preprint arXiv:2307.08621, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.813888Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:f8aee2f6432bd4ff51951040dbced2ad1d4a63855f1f079fd2f75f00548bf714","observation_id":"affa02d5-02da-4bd1-9626-0ad06068fbf0","resolution":{"observed_at":"2026-08-11T17:02:06.813888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.466843Z","title":"Gated linear attention transformers with hardware-efficient training","venue":null,"work_id":"35b6e55e-c139-41fd-adbf-d3a331172c4c","year":2024},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.818921Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:8bfe1aaaf76ade97115c22bcd71e52bc59e9547477972f47aca5f0d9cfc56264","observation_id":"a4d0d1ab-6067-46f6-b07d-9b14f63f7418","resolution":{"observed_at":"2026-08-11T17:02:07.472604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.451058Z","title":"Transformers are rnns: fast autoregressive transformers with linear attention","venue":null,"work_id":"3894cfd4-802c-4df2-befe-17940712039b","year":2020},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.823323Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:b268867833f29bc027f36dcea30331f5276118125e467e616fdb15435f81ebfb","observation_id":"d97789cb-2202-4d0a-abf9-2067798803ac","resolution":{"observed_at":"2026-08-11T17:02:07.456246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.434787Z","title":"Efficient attention: attention with linear complexities","venue":null,"work_id":"e995222c-cc57-4d2e-906c-f446bbc650ce","year":2021},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.827677Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:a5852dd9557da2e332a77b7b09245a64d8e299ae3dfe29bd49899a057de8050f","observation_id":"3efb5ef3-2a30-4674-972b-c354604964b1","resolution":{"observed_at":"2026-08-11T17:02:07.439782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.418944Z","title":"Linear transformers are secretly fast weight programmers","venue":null,"work_id":"d363ca53-2d03-4996-ba62-fc9e42699aed","year":2021},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.832401Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:469a92415a75e77e6e6cc6f0c47056406985664c4651621a32ec46c632a0848f","observation_id":"7af4b9ed-8273-4831-8def-e00b15592c32","resolution":{"observed_at":"2026-08-11T17:02:07.423943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.403425Z","title":"Flatten transformer: vision transformer using focused linear attention","venue":null,"work_id":"d61514b7-4e65-4df7-80b5-77a2858b1a64","year":2023},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.837260Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:c700bfb108b29fe6054e595805078a73926346d9cdfeb2525a82fc7611e6231b","observation_id":"349fb060-3e53-4895-95f2-46bc8956a66f","resolution":{"observed_at":"2026-08-11T17:02:07.408559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.383449Z","title":"Polaformer: polarity-aware linear attention for vision transformers","venue":null,"work_id":"357f4542-2046-4df1-b249-09c61ab535f2","year":2025},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.841842Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:8c2d522587238b86b622849f591cf55eda0501149dfbd767b19b4ac9bb325759","observation_id":"902f38e1-f551-4875-817b-b88076078383","resolution":{"observed_at":"2026-08-11T17:02:07.389436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.14902","last_updated":"2020-08-20T05:43:22Z","snapshot_observed_at":"2026-08-18T19:24:54.162160Z","submitted_at":"2020-07-29T15:18:46Z","title":"Linear Attention Mechanism: An Efficient Attention for Semantic Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.14902","snapshot_observed_at":"2026-08-11T17:02:06.846478Z","title":"Linear attention mechanism: an efficient attention for semantic segmentation","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.846478Z"},"links":{"cited_paper":"/paper/2007.14902","citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:156609096347638ecada0d726e76e63eb2c9e2832447b8b4012e108c55cde1bb","observation_id":"e04374ce-f3de-4284-ac12-4545da574cf5","resolution":{"observed_at":"2026-08-11T17:02:06.846478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.364895Z","title":"Random feature attention","venue":null,"work_id":"14f8f7c1-8936-4ebb-aaf4-df9b4630e51a","year":2021},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.851757Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:b957bb02001cba3ee2446aedc62a0d9c5c013e652eaee07a14cb5fba1505dc60","observation_id":"ec9b2a3f-6171-4bbc-836e-9a14c1f6e354","resolution":{"observed_at":"2026-08-11T17:02:07.370028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.348817Z","title":"Rethinking attention with performers","venue":null,"work_id":"204dc314-4d36-45ee-b5df-5a4c6b56f12d","year":2021},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.856505Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:0b7951f7a2eeeb47826c4cc2a70b599e4d5c13dcfdfce5744cab408d289e34a7","observation_id":"df083ca3-9ea6-4d5e-8adb-151c05bc334b","resolution":{"observed_at":"2026-08-11T17:02:07.354293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.332213Z","title":"Mamba: linear-time sequence modeling with selective state spaces","venue":null,"work_id":"c0ef96d2-12b0-4b48-882c-5d0dcb548315","year":2024},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.861100Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:576bd65868cd4c146075a4e1056adce60c54f79f170ddc970640b3213a8e71b8","observation_id":"207c6656-18d6-4fc9-ab07-ec9c10cf617b","resolution":{"observed_at":"2026-08-11T17:02:07.337411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.316645Z","title":"Transformers are ssms: generalized models and efficient algorithms through structured state space duality","venue":null,"work_id":"4881e54c-260e-4770-9281-817ecc9f4188","year":2024},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.865999Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:d2c5778792d434fe8755a5451177f7ffea7b59a6212c3806cf1eff5e7320804e","observation_id":"6bcdf29d-0268-42a2-936e-30e01f8fa144","resolution":{"observed_at":"2026-08-11T17:02:07.321854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14103","last_updated":"2021-09-21T18:04:55Z","snapshot_observed_at":"2026-08-18T19:26:09.782817Z","submitted_at":"2021-05-28T20:45:30Z","title":"An Attention Free Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14103","snapshot_observed_at":"2026-08-11T17:02:06.870460Z","title":"An attention free transformer.arXiv preprint arXiv:2105.14103, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.870460Z"},"links":{"cited_paper":"/paper/2105.14103","citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:ea02a044e707a4c7dfa711bddad506efda6c55657a1897f4851d03521383c42a","observation_id":"b3b9a948-da53-456b-918c-639b4a1da352","resolution":{"observed_at":"2026-08-11T17:02:06.870460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.299774Z","title":"Rwkv: Reinventing rnns for the transformer era","venue":null,"work_id":"3fdfbc51-bf35-4639-b01e-c8c1f49f283a","year":2023},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.875703Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:fed3f2c2d448b9d7364da57b5a2536b4fde0fda18b07c86f24ebb6ec9494eba0","observation_id":"366b724a-9899-4afc-89e5-c6030e9a6aa5","resolution":{"observed_at":"2026-08-11T17:02:07.305242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:06.880665Z","title":"Group normalization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.880665Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:c202d0eb6e552a47d85e1909818040535d8ea707604e43afbbb0b25bc472d43f","observation_id":"e551ac0a-a7a5-42e3-954b-488100443664","resolution":{"observed_at":"2026-08-11T17:02:06.880665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14756","last_updated":"2024-02-06T02:57:35Z","snapshot_observed_at":"2026-08-16T16:56:49.596417Z","submitted_at":"2022-05-29T20:07:23Z","title":"EfficientViT: Multi-Scale Linear Attention for High-Resolution Dense Prediction","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14756","snapshot_observed_at":"2026-08-11T17:02:06.885235Z","title":"Efficientvit: enhanced linear attention for high-resolution low-computation visual recognition.arXiv preprint arXiv:2205.14756, 3(1), 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.885235Z"},"links":{"cited_paper":"/paper/2205.14756","citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:4ace5c5bebedda77c5a671c1f999a4724586f842d4eb707e6181f56507653c2a","observation_id":"fded8756-0e96-4f2e-b5e6-fe98c74c77b2","resolution":{"observed_at":"2026-08-11T17:02:06.885235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.268195Z","title":"Soft: softmax-free transformer with linear complexity.Proceedings of the 2021 Advances in Neural Information Processing Systems, NeuraIPS, 34:21297–21309, 2021","venue":null,"work_id":"1998f5aa-0ceb-447f-a3b3-ad12a52436c6","year":2021},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.890292Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:040f665f8a4647704adf6eb4c4c15d353eefd14f00a6d403aed2eaa8d838b033","observation_id":"dd78c79f-08f4-42e2-ae0f-67a5679d4a35","resolution":{"observed_at":"2026-08-11T17:02:07.274337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.248609Z","title":"Nystr¨omformer: a nystr ¨om-based algorithm for approximating self-attention","venue":null,"work_id":"f545feef-1a2a-4578-a4de-c75598213004","year":2021},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.895575Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:493f462a54d777b2c53d1d29d442972169ddb95afe6eb1c44439d4a6b42838b4","observation_id":"f91b6789-a3d1-4e26-9a39-a2b67165695a","resolution":{"observed_at":"2026-08-11T17:02:07.254217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.230564Z","title":"Outrageously large neural networks: the sparsely-gated mixture-of-experts layer","venue":null,"work_id":"a949d942-4915-4308-ad3d-142e3a98395a","year":2017},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.900238Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:fd95cab8d8929443c07e21098f3b020b37742b86b75570a4e2b1e9e9605a6cbf","observation_id":"594cde54-6c43-4f90-abf2-a79a4cdf328c","resolution":{"observed_at":"2026-08-11T17:02:07.236513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.211161Z","title":"Don’t give me the details, just the summary! topic-aware convolutional neural networks for extreme summarization","venue":null,"work_id":"1d6b4ca7-0a99-424f-8622-b8d3cf7c95c5","year":2018},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.904806Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:c32cc21df798da6b2c7177e44cc3fa94056640012e123b1e75c9085ee2aaff54","observation_id":"11156257-0005-4f0a-aff0-29a3e7c52132","resolution":{"observed_at":"2026-08-11T17:02:07.217429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.192829Z","title":"Long range arena: a benchmark for efficient transformers","venue":null,"work_id":"c81e48fb-848f-4f84-8dfb-49e88ac08c49","year":2020},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.909593Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:92a7466ea63f15c22f5a757a991872622553a4800b16ec0c341dd2d1ce434fa2","observation_id":"12c2d22a-8cee-4abb-9529-43cf6d45b9cb","resolution":{"observed_at":"2026-08-11T17:02:07.198005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.173820Z","title":"Listops: a diagnostic dataset for latent tree learning","venue":null,"work_id":"512d8f55-ab2b-4b58-bf77-93ab8d90c25c","year":2018},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.914154Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:891aee7aa256c5d2a0dcad4649fd7bcb1fc3da33ba7b7271e0dfa929c0aebdd8","observation_id":"985d0c57-9069-4181-bcf6-3803bf82d05e","resolution":{"observed_at":"2026-08-11T17:02:07.180622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.156915Z","title":"Learning word vectors for sentiment analysis","venue":null,"work_id":"9cd2a4d0-af28-464d-afcf-f15abcc4340e","year":2011},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.918732Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:10416333d2e94ef1cce5d8f480f00aae36fd73100faf9e46fd3a9e0cabe47a9d","observation_id":"b2114500-42d9-4d0a-8f99-32bfeb3f4060","resolution":{"observed_at":"2026-08-11T17:02:07.162071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.141162Z","title":"The acl anthology network corpus.Language Resources and Evaluation, 47(4):919–944, 2013","venue":null,"work_id":"2963161d-2081-4046-ae66-5fd658cff627","year":2013},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.923391Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:cbf51d4ff421c680d88d60e2de65f1732e76d60636179d89931f371a8109ef5a","observation_id":"e8449253-7c69-42bd-b3e2-7f360bc81a69","resolution":{"observed_at":"2026-08-11T17:02:07.146128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.123163Z","title":"Learning long-range spatial dependencies with horizontal gated recurrent units.Proceedings of the 2018 Advances in Neural Information Processing Systems, NeuraIPS, 31, 2018","venue":null,"work_id":"d00b34f7-f866-47d4-9677-1547a1bed064","year":2018},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.927739Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:e0fba759a6b9548be3737c9f65b30f23b658146a1f7ede15af3a9b5ad8e6c4e3","observation_id":"a66fb356-0427-48a0-ba50-37fff294600b","resolution":{"observed_at":"2026-08-11T17:02:07.128493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:06.932524Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.932524Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:b30952b2eaf54a81c2b2abe945039bd6e3c9675577d5ac62cd3c0a15c73d7979","observation_id":"867a0f1f-591f-4288-9ec6-cfd59ae19a5d","resolution":{"observed_at":"2026-08-11T17:02:06.932524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:02:07.094347Z","title":"Emnist: Extending mnist to handwritten letters","venue":null,"work_id":"67988ea5-e600-4b7b-b44d-dbabaef0d2e7","year":2017},"citing_paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T17:02:06.937137Z"},"links":{"citing_paper":"/paper/2608.09468"},"observation_digest":"sha256:1c7ae4ffd5d948a370268d55a15a711c424485976163390759ebc0bdfae93271","observation_id":"12adb45a-901c-4675-b703-276e1affadcb","resolution":{"observed_at":"2026-08-11T17:02:07.101239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.09468","last_updated":"2026-08-10T11:38:30Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T19:26:07.425831Z","submitted_at":"2026-08-10T11:38:30Z","title":"MixFormer: Linear Transformer with Mixture of Memory Experts"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2608.09468."}