{"as_of":"2026-08-23T05:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:75a5652ec06b420e7e8c0c5d8460d3db4096a7b05eaea24d91af48560f757c59","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T10:06:51.628147Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.27748/citation-record","integrity":"/paper/2606.27748/integrity","json":"/paper/2606.27748/citation-record.json","paper":"/paper/2606.27748"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.861284Z","title":"Simple linear attention language models balance the recall- throughput tradeoff","venue":null,"work_id":"a18785d9-e8cf-447d-b8e8-cc4c5bf0d9f8","year":2024},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:8583b9db3e4b53992d666dba55bf024874081ea5158b03df7df764d49cef14d3","observation_id":"5ac9e262-1030-4299-9623-3459469c60dc","resolution":{"observed_at":"2026-07-09T15:26:18.862508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.852107Z","title":"Adaptive input representations for neural language modeling","venue":null,"work_id":"346aaab2-34a6-4d17-907a-f9e17c129c76","year":2019},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:caaa06288478d0b11d4dfbe24924d51df4e46098cf94b85c226a407098deea4b","observation_id":"78583070-fe6e-4fb4-9cd4-52aeb22a74fe","resolution":{"observed_at":"2026-07-09T15:26:18.853260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.842949Z","title":"Peters, and Arman Cohan","venue":null,"work_id":"7e2a6943-4643-49c9-b6e9-87a4a64e6a63","year":2020},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:252a1ddff627804d295caec9d2143a89ff5e06919ff92325c6236214ca3291a0","observation_id":"989560e7-6ee7-4f61-9394-2fecddc23cc3","resolution":{"observed_at":"2026-07-09T15:26:18.843985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.884309Z","title":"Courier Corporation, 2005","venue":null,"work_id":"9126272a-ac98-4ccd-9ace-b02fdb851429","year":2005},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:2555527e83ae148eb2152023f611a45cf5f8cf572b0fda74b996e7c1dbb262d1","observation_id":"285ad435-42c0-4107-a050-4507d03efdd5","resolution":{"observed_at":"2026-07-09T15:26:18.885391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.875090Z","title":null,"venue":null,"work_id":"61c688b0-3aff-42e4-a78f-6299dcf9715d","year":2020},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:acab2cd229baf2609036eb4ab6737fa4e2280ff347f5bbff93037f3885be85a9","observation_id":"cb0c95cf-932a-4162-bb9b-a34db98c9e38","resolution":{"observed_at":"2026-07-09T15:26:18.876169Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:19.117656Z","title":"Skyformer: Remodel self-attention with gaussian kernel and nyström method","venue":null,"work_id":"39efb542-1e0c-49d3-a55c-0275214e0d09","year":2021},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:e8d7f1f22b27ad7a50409b55ae4ff9ec5aa027bb0c8209c4dac85257d16dd9e0","observation_id":"957250ce-f71b-4ec4-a104-6df532f4ef1f","resolution":{"observed_at":"2026-07-09T15:16:19.118830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.855834Z","title":"Colwell, and Adrian Weller","venue":null,"work_id":"e39726a7-eda5-4964-9c8d-8dde5821fdca","year":2021},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:ad75c7d6fdb866cc7410bb5412e3f067593fb2570ea8070dc149fbf0af493c25","observation_id":"3b1c9a11-4a08-4164-a7ed-ef5bcab0f151","resolution":{"observed_at":"2026-07-09T15:26:18.857100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.854077Z","title":"An exploration of softmax alternatives belonging to the spherical loss family","venue":null,"work_id":"0c3c15e8-e3ff-4b81-accc-5f1926b11927","year":2016},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:0c9f92e68b9313daad51c79bd1c0b973657c4d80c6d40a9ab6439d136f6a3dbf","observation_id":"d977218f-d7f1-4e56-8caa-e6291a47c60d","resolution":{"observed_at":"2026-07-09T15:26:18.855244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.895284Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"cc836bcf-adf8-4dc6-897a-9e2a50caa22a","year":2019},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:f223883dca1f517ce926a4c96c7c119d14e620b260156b917c64e3bcfd713a64","observation_id":"7a6e44d5-86f2-4831-b2ca-14bd101ec81d","resolution":{"observed_at":"2026-07-09T15:26:18.896562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.875269Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"b2cc82a1-974a-4867-8a88-379d15de9985","year":2021},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:183c35217b41c3bb9b7340d899cd6e119c3e23bc40525e3de72338e841c5b29c","observation_id":"5b28ac1b-b29c-4e1f-9509-f8c7da9ba433","resolution":{"observed_at":"2026-07-09T15:26:18.876488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.876993Z","title":"Building blocks for a complex-valued transformer architecture","venue":null,"work_id":"977078e6-b6ab-4a9c-8841-12db9edf52ba","year":2023},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:8cc479663f5c13437e3955d5150cdf92f78cb6f38b30f986a1850315f1e67dbd","observation_id":"4f3562b4-5559-4191-9557-5e20c74043a4","resolution":{"observed_at":"2026-07-09T15:26:18.878306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.873411Z","title":"Parallel and serial grouping of image elements in visual perception.Journal of Experimental Psychology: Human Perception and Performance, 2010","venue":null,"work_id":"cdcdb185-bacc-45a0-a763-9c620f195946","year":2010},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:d4addb9622ad1cdf15af6ecfc4f834937bd5115b005a033352b4fcbf4cd66a2c","observation_id":"b82fece8-0c89-41cc-b515-783b5dc3c780","resolution":{"observed_at":"2026-07-09T15:26:18.874683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:19.143820Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":"216a0bd9-2823-41f9-8c5d-337b05939501","year":2020},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:285a76fa6dee10f2d0b34f2a4e144a74701191f9d2707ff401ba7f261f7c460c","observation_id":"56aeab89-6d20-4c55-9d44-37da58605d94","resolution":{"observed_at":"2026-07-09T15:16:19.145175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.790648Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"961ef8a5-d589-421a-807e-e454fd585949","year":2015},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:5e607c4236c4eb63247c159bbdff42f093ada6f7540edc92d0c15e51bac71b59","observation_id":"6f769275-31bf-49a8-ab06-19e786c2b01a","resolution":{"observed_at":"2026-07-09T15:26:18.880023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.882600Z","title":"Reformer: The efficient transformer","venue":null,"work_id":"adf0b21e-4f59-4801-b411-e1e6d7fe266e","year":2020},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:e418d95669551887cc0e2f7094f3091dcebbe84718e596e398db1772a739c98a","observation_id":"ada2f3fa-384e-4da6-a87d-1ab9efd367b7","resolution":{"observed_at":"2026-07-09T15:26:18.883667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:19.113733Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":"298093d0-0364-4ca5-879f-2ee9aaff0d97","year":2009},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:79a50dc058437e093ca7efa959496fd39a0659f3233adb3202a48b6f80be88a5","observation_id":"96dc22df-033a-49c0-bc8a-6eb5f208c293","resolution":{"observed_at":"2026-07-09T15:16:19.115064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:19.111778Z","title":"Figueiras-Vidal","venue":null,"work_id":"d202c73b-dc93-4132-8872-19786a4cb68e","year":2010},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:74fdce2684feecbecf7f6e444371ab3699622ace0554a802519d73f271fea6cc","observation_id":"0a65fc9f-1e67-412a-a781-75a6d9a51c2f","resolution":{"observed_at":"2026-07-09T15:16:19.112829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:19.139779Z","title":"Roberta: A robustly optimized bert pretraining approach.arXiv, 2019","venue":null,"work_id":"52178b77-6a11-409c-8b51-8bee73f5a790","year":2019},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:74d0a6b13dfbe544e5df53ce5985492ef285d383e1713ab578ac3a24a1de69a8","observation_id":"b54375a6-ef0e-456b-9eb7-ad0656f42314","resolution":{"observed_at":"2026-07-09T15:16:19.141136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.885990Z","title":"itransformer: Inverted transformers are effective for time series forecasting","venue":null,"work_id":"778590bd-8eef-4908-a05a-8e1cf4e7e8d3","year":2024},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:d8b8edfa21c4d7f5aa946c89855e887e3441bfbad59b71097b83c69b7bf04b85","observation_id":"f844982d-21aa-4ad9-8b20-d59e100f8f4d","resolution":{"observed_at":"2026-07-09T15:26:18.887171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.897055Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"4cb3b92f-6088-41c4-92d5-8e531976662b","year":2021},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:d7cdc3f4a50add2224c919ab84bc0ed4b3222220d3f326a523862a175e3ad02e","observation_id":"b5f6851c-92df-440b-9f9a-70e17f7c8d1d","resolution":{"observed_at":"2026-07-09T15:26:18.898258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.871471Z","title":"Maas, Raymond E","venue":null,"work_id":"cdb4d29e-4d02-459a-8013-337e1982cbda","year":2011},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:47e18add4a6f299a403e56c3b3a3c9fb89b96ceeae34d4018aaf0e12fc3d4d07","observation_id":"d3752728-1c40-429b-ba3f-a9faa7f6ad97","resolution":{"observed_at":"2026-07-09T15:26:18.872787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.893341Z","title":"Polaformer: Polarity- aware linear attention for vision transformers","venue":null,"work_id":"74c1bc43-a226-4bf5-9f91-1725dfc2a50d","year":2025},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:8e052cf6d4914b7b08b8b63e740b38ee75c1792ea64ca205cc9c292cc1ca81d4","observation_id":"6bacb3c7-83b2-462c-a3c6-902b94d82d09","resolution":{"observed_at":"2026-07-09T15:26:18.894459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:19.141805Z","title":"Pointer sentinel mixture models","venue":null,"work_id":"11b009f0-d277-4043-b41f-45148f44bbef","year":2017},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:d1a5e3b20c5860d6c4f5fbfa91fc805cd30b318a737c986d51db966c32c41d68","observation_id":"c94f2af3-5aa2-4cc7-99c6-0db6cd123f97","resolution":{"observed_at":"2026-07-09T15:16:19.143183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.852470Z","title":null,"venue":null,"work_id":"453eeb76-9f1a-4335-b8fe-172b7578a1e6","year":2018},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:e362e16917ba5a3dc2bddebdeb9a5a97c2df1d98c9e3a6cb918a0701a02d254d","observation_id":"b3e47719-c030-4462-a43c-22e4f85ca298","resolution":{"observed_at":"2026-07-09T15:26:18.853552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.883009Z","title":"Nguyen, Phanwadee Sinthong, and Jayant Kalagnanam","venue":null,"work_id":"a61e38df-6a84-47f6-bab3-5ebe2d2dea78","year":2023},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:aa8b93aefe9fe62ed133ad8237a94790d838d40a67281a359a7b310787b2f403","observation_id":"5c19b8e7-038b-4e24-bc25-2a8e734040a7","resolution":{"observed_at":"2026-07-09T15:26:18.884133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01038","last_updated":"2019-04-01T18:05:02Z","snapshot_observed_at":"2026-08-17T03:00:45.737117Z","submitted_at":"2019-04-01T18:05:02Z","title":"fairseq: A Fast, Extensible Toolkit for Sequence Modeling","version":1},"cited_work":{"arxiv_id":"1904.01038","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.01038","snapshot_observed_at":"2026-07-01T23:06:20.161421Z","title":"fairseq: A Fast, Extensible Toolkit for Sequence Modeling","venue":"cs.CL","work_id":"60f0096a-3ae5-43f2-9275-a23a441325dc","year":2019},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"cited_paper":"/paper/1904.01038","citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:f9a81118e6e511b5e0a793dcc6f1eed0f9591daa59c53a773507ee7f812fb0bc","observation_id":"2e83538d-38cb-4d75-875e-1571f4e2cedf","resolution":{"observed_at":"2026-06-30T12:54:40.216369Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.887856Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":"999aac67-2a63-4226-9e36-d9358b062b77","year":2019},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:b575d82fa3f87ec6fcf7733d85a7e87e17e7f7c379c126b9807e38148951b3aa","observation_id":"ce7a51b7-4df9-47f5-97a3-ce6deb4e1dcb","resolution":{"observed_at":"2026-07-09T15:26:18.889076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.889650Z","title":"Random feature attention","venue":null,"work_id":"cf714735-950b-4e8d-8799-38142fc14397","year":2021},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:593b47853e07c411ff51136f591cc0abaf7d08e2971c64f1220d4763305fa070","observation_id":"f0edf8da-8323-4773-ab52-453d47b0b06f","resolution":{"observed_at":"2026-07-09T15:26:18.890747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:19.145777Z","title":"cosformer: Rethinking softmax in attention","venue":null,"work_id":"a2f95d08-f064-4c05-90cd-aa5c61972861","year":2022},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:51b34fe0e5583436ba97968fb9e4a9f9b28582ca5519318642858ff83b23abfa","observation_id":"5e76a1bc-4e38-4c18-bff8-8d4431f4fc33","resolution":{"observed_at":"2026-07-09T15:16:19.147021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.900476Z","title":"Radev, Pradeep Muthukrishnan, and Vahed Qazvinian","venue":null,"work_id":"ced553ab-c908-44ab-af4d-c5975ca864fd","year":2009},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:4e533fd515e1032e3896be06896a763f60b6c9d8563d79fdaddc73f9e8c9e415","observation_id":"f6587053-a665-4270-a64b-1f707dcabc63","resolution":{"observed_at":"2026-07-09T15:26:18.901541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:19.115808Z","title":"Random features for large-scale kernel machines","venue":null,"work_id":"662c9ed9-3b53-4ee9-89ea-c6770471360b","year":2007},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:fc9672ff844c57378da06ef6af5f7900074c1e40de234124b340c717c4284737","observation_id":"907892fb-0d91-4fb7-be2d-714c21007503","resolution":{"observed_at":"2026-07-09T15:16:19.117067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.846921Z","title":"Efficient content- based sparse attention with routing transformers","venue":null,"work_id":"b825f8cc-efae-48c1-9f7f-316ebdbba7df","year":2020},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:ffe4fb6f150aaddaca534a0c80e54760534bbc4a785d8b915f418350764ffa16","observation_id":"e1c15487-4fa1-4194-bf92-18bb40091f6d","resolution":{"observed_at":"2026-07-09T15:26:18.848074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:318a9ae7102e44a4b309f9217cd0c51e635609b487731668403020b587ae4d40","observation_id":"93435d25-db93-479d-8e4f-1ab7fdc1df1a","resolution":{"observed_at":"2026-06-30T12:54:40.213982Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.880608Z","title":"Fundamentals of recurrent neural network (rnn) and long short-term memory (lstm) network.Physica D: Nonlinear Phenomena, 2020","venue":null,"work_id":"0f25af1e-4006-4a7f-acbc-eca47c0b05ff","year":2020},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:a0c4ddbdaa66c7ad31323d5235b026a591501152be7d2c782157dba9727256ed","observation_id":"0e3be53c-06e4-410a-9080-e2415116c509","resolution":{"observed_at":"2026-07-09T15:26:18.881786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.891473Z","title":"Understanding the differences in foundation models: Attention, state space models, and recurrent neural networks","venue":null,"work_id":"08bfa577-e67d-4bc6-af3b-51771371c470","year":2024},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:85b8a9c3b5707d22ae547ce5ef298dd996df673961b61fbe51e09dd181bb0035","observation_id":"0120c4fd-bc84-4f5b-a3b3-db5799952836","resolution":{"observed_at":"2026-07-09T15:26:18.892779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.898784Z","title":"Nonstationary sparse spectral permanental process","venue":null,"work_id":"c8dcc514-7fef-4518-98a1-cb842e795376","year":2024},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:1fcd68dde3d3c79ae932ff8f3437669d4b9b6d9baee55d3e7cb270011f84e0a0","observation_id":"ba51912e-fe65-4c6e-a19a-0ae50b72e66d","resolution":{"observed_at":"2026-07-09T15:26:18.899951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.867790Z","title":"Long range arena: A benchmark for efficient transformers","venue":null,"work_id":"0e6cac87-e32b-4b29-8e3c-d63ec540b292","year":2021},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:8702bf112072178bf7add658af6dc267018eec0848eb0de316bbdd605d8c20e4","observation_id":"c49e48d5-1eec-43e3-b58a-991e9ffebd4d","resolution":{"observed_at":"2026-07-09T15:26:18.868971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.863716Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"1f0543f0-4254-4a99-8c2d-cc86fa2e1e49","year":2017},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:4774ed96259ebc1c64db59665ba56613e63362821bfb233432b01b7f9a4cfc7e","observation_id":"6d0acc53-c805-4628-8c66-7ae47be3b79c","resolution":{"observed_at":"2026-07-09T15:26:18.865389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.865927Z","title":null,"venue":null,"work_id":"62c4e4c7-05ba-4839-a04e-953bf7a7135c","year":2018},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:b62ddca9315f604bca229a7604c9f974eb9e613813f423dc10ae418fd9a94346","observation_id":"95155659-de7f-4f1a-8b11-e6eb95efe953","resolution":{"observed_at":"2026-07-09T15:26:18.867067Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.861727Z","title":"Yaglom.Correlation Theory of Stationary and Related Random Functions, Volume I: Basic Results","venue":null,"work_id":"53511811-4e20-4388-9dbc-40a6aff939e5","year":1987},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:89ee03a2a210ec6b54e8695c18148ba9c8bc6f02515a285e29bf5812259afafd","observation_id":"34556e74-f894-4920-8ea7-3d9675d8e042","resolution":{"observed_at":"2026-07-09T15:26:18.862926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.855647Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":"d449a755-2936-4a9d-a57f-312c6d7618ad","year":2020},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:7a20f8cd3edbf541faf81c27d2bb1f1e3468f4f6ce1af0c470250b2a4c6c73ae","observation_id":"8ddd0457-c472-4c89-b898-832cc173be0c","resolution":{"observed_at":"2026-07-09T15:26:18.856915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.869466Z","title":"The hedgehog & the porcupine: Expressive linear attentions with softmax mimicry","venue":null,"work_id":"14a3a926-1519-4e09-904e-240b22d7a9cc","year":2024},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:3004c7a3f849867c8775f0dfb6d6947c542353fa85880d6409ca95a949c8c892","observation_id":"8221a407-aa3a-46d0-96e9-18225de193fd","resolution":{"observed_at":"2026-07-09T15:26:18.870897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.863166Z","title":"Good\" and 4,790","venue":null,"work_id":"847615b8-14a5-4011-833c-1760ac2975b1","year":2021},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:b6ccca68fb717e7fe70efa5ba1f3ac568bef84f4c5be61f16991d4f5c232a1bd","observation_id":"c879bd4f-35b6-428a-a266-aa54cb44ef3b","resolution":{"observed_at":"2026-07-09T15:26:18.864269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":2,"verified_fuzzy":38},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2606.27748."}