{"as_of":"2026-08-18T20:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b06ba0a806e203ebc3af979614e9c9889617b0ae25fd01a4518dba7ac534f175","coverage":[{"denominator":108,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:49:30.598041Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:22:53.184571Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T07:56:26.787347Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09022","snapshot_observed_at":"2026-08-05T10:22:53.184571Z","title":"Block-biased mamba for long-range sequence processing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04226","last_updated":"2025-09-04T13:56:47Z","snapshot_observed_at":"2026-08-10T01:43:38.207868Z","submitted_at":"2025-09-04T13:56:47Z","title":"Rethinking the long-range dependency in Mamba/SSM and transformer models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:53.184571Z"},"links":{"cited_paper":"/paper/2505.09022","citing_paper":"/paper/2509.04226"},"observation_digest":"sha256:882cfbbc517f5101ae88eae656f577af095b821793978d4e739c1f82e9a4f1dc","observation_id":"89402e50-ca0e-44ae-ae9a-9e864dd8a10f","resolution":{"observed_at":"2026-08-05T10:22:53.184571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09022","snapshot_observed_at":"2026-08-03T01:07:31.507642Z","title":"and Erichson, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10743","last_updated":"2026-06-10T14:22:59Z","snapshot_observed_at":"2026-08-18T01:39:48.873323Z","submitted_at":"2026-02-11T11:11:45Z","title":"Kalman Linear Attention: Parallel Bayesian Filtering For Efficient Language Modelling and State Tracking","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T01:07:31.507642Z"},"links":{"cited_paper":"/paper/2505.09022","citing_paper":"/paper/2602.10743"},"observation_digest":"sha256:8450525dc547e4eff8c581ab046cb5f2c35f528b41d4167ca0c665be54bb0bef","observation_id":"86a4d40d-c8af-497f-ad2e-409f3385a5f7","resolution":{"observed_at":"2026-08-03T01:07:31.507642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"cited_work":{"arxiv_id":"2505.09022","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.09022","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.09022 , year=","venue":null,"work_id":"912a7237-fafe-41a5-8265-a728c72d471b","year":null},"citing_paper":{"arxiv_id":"2605.08539","last_updated":"2026-05-08T22:55:45Z","snapshot_observed_at":"2026-08-15T03:08:29.578150Z","submitted_at":"2026-05-08T22:55:45Z","title":"Continuity Laws for Sequential Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-12T01:32:13.445719Z"},"links":{"cited_paper":"/paper/2505.09022","citing_paper":"/paper/2605.08539"},"observation_digest":"sha256:f1feacf22e42752237db64532d5b2ba309c6b450809ec6a0586f6a5bc3a867c9","observation_id":"4acf473a-4036-4b6f-82f8-ed7e72ec4b63","resolution":{"observed_at":"2026-05-12T07:56:26.796144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.09022/citation-record","integrity":"/paper/2505.09022/integrity","json":"/paper/2505.09022/citation-record.json","paper":"/paper/2505.09022"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.06837","last_updated":"2024-07-11T14:35:23Z","snapshot_observed_at":"2026-08-16T14:35:42.932847Z","submitted_at":"2023-12-11T21:00:28Z","title":"Spectral State Space Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06837","snapshot_observed_at":"2026-08-15T21:49:30.239583Z","title":"Spectral state space models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.239583Z"},"links":{"cited_paper":"/paper/2312.06837","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:a3a94794007049664d4f14272485b299d3545d25472a4f029d353ec86110de5f","observation_id":"89741f7e-8577-4a0e-a53f-0ffd725f82da","resolution":{"observed_at":"2026-08-15T21:49:30.239583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.244372Z","title":"Learning and generalization in overpa- rameterized neural networks, going beyond two layers","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.244372Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:8c66f10d4a8fc1ac1e18b151e103a17baa808f43d4517e13d967ed59d74654b2","observation_id":"e6bed80c-4277-4a5e-8700-9801a0cc4237","resolution":{"observed_at":"2026-08-15T21:49:30.244372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16899","last_updated":"2024-03-25T16:10:47Z","snapshot_observed_at":"2026-08-16T14:06:37.290287Z","submitted_at":"2024-03-25T16:10:47Z","title":"State Space Models as Foundation Models: A Control Theoretic Overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16899","snapshot_observed_at":"2026-08-15T21:49:30.248180Z","title":"State space models as foundation models: A control theoretic overview","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.248180Z"},"links":{"cited_paper":"/paper/2403.16899","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:761e97c59854af5f533fac2f7fe2139b9b8ba1e929180ab6d19f4601bb5aec06","observation_id":"6d7d45f0-c224-4568-965e-ad6856f08653","resolution":{"observed_at":"2026-08-15T21:49:30.248180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.06104","last_updated":"2018-03-07T10:49:28Z","snapshot_observed_at":"2026-08-17T18:58:08.791936Z","submitted_at":"2017-11-16T14:19:29Z","title":"Towards better understanding of gradient-based attribution methods for Deep Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.06104","snapshot_observed_at":"2026-08-15T21:49:30.252137Z","title":"Towards better under- standing of gradient-based attribution methods for deep neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.252137Z"},"links":{"cited_paper":"/paper/1711.06104","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:65939428949f50e28a9daa1ebcd147eae982707c813569b02784c9841dd982f1","observation_id":"5ad30b87-444c-4fb0-a5c0-f14cf332f477","resolution":{"observed_at":"2026-08-15T21:49:30.252137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.256222Z","title":"Intrinsic dimension of data representations in deep neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.256222Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:889dd6a429d7b2a918de6296cf94323d86b0a3867fe264805a2352d147583eba","observation_id":"7a95fe0e-2f97-415a-af82-7d9d396be232","resolution":{"observed_at":"2026-08-15T21:49:30.256222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.260006Z","title":"Unitary evolution recurrent neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.260006Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:f60647a3a6ba6d9cec9a4b0cb117f24149a8b1e316fd28120412d0341b405857","observation_id":"b1d0bb3f-9505-4578-a669-88c29fc43e7d","resolution":{"observed_at":"2026-08-15T21:49:30.260006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.263955Z","title":"Fine-grained analysis of optimization and generalization for overparameterized two-layer neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.263955Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:d1ba3000cd11c21baa9da7c6cd8f7638b81386e4d90ec97e58008c9e0b8ed588","observation_id":"1136295c-d80c-4bc5-a786-7914580cde1b","resolution":{"observed_at":"2026-08-15T21:49:30.263955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.267439Z","title":"How to explain individual classification decisions","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.267439Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:19ca68c4fe670252d71831338bab51897b77bcdcb0bffadc422a5d8e8d30d335","observation_id":"847d7662-8703-49c8-8b83-aa8a47328da2","resolution":{"observed_at":"2026-08-15T21:49:30.267439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.01271","last_updated":"2018-04-19T14:32:38Z","snapshot_observed_at":"2026-08-13T10:37:24.864456Z","submitted_at":"2018-03-04T00:20:29Z","title":"An Empirical Evaluation of Generic Convolutional and Recurrent Networks for Sequence Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.01271","snapshot_observed_at":"2026-08-15T21:49:30.270969Z","title":"An empirical evaluation of generic convo- lutional and recurrent networks for sequence modeling","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.270969Z"},"links":{"cited_paper":"/paper/1803.01271","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:17a9fda5153f74a285e577e78dca745344858943c10c4c136f8b003d6a2c3c4f","observation_id":"057a9632-dbe1-4a8b-8e8f-71f54da692cd","resolution":{"observed_at":"2026-08-15T21:49:30.270969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.274831Z","title":"Deep learning: a statistical viewpoint","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.274831Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:35a635d15b906b402fd5ad46b786db8936ded7157b0961d2da61e8312d72f355","observation_id":"3159bb4a-4f79-4512-b9e8-1f66e7243223","resolution":{"observed_at":"2026-08-15T21:49:30.274831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.278321Z","title":"The convergence rate of neural networks for learned functions of different frequencies","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.278321Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:fef687f29c22d2b8d01c689cb9de24dea0af77f0c316c9d3dec0a367d0cb6660","observation_id":"a878fc1d-2b3d-499f-8407-289d1b880459","resolution":{"observed_at":"2026-08-15T21:49:30.278321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17729","last_updated":"2025-04-11T00:35:25Z","snapshot_observed_at":"2026-08-16T14:35:28.847084Z","submitted_at":"2024-11-22T05:30:03Z","title":"Fast convolution algorithm for state space models","version":3},"cited_work":{"arxiv_id":"2411.17729","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.17729","snapshot_observed_at":"2026-08-15T21:49:30.970746Z","title":"Fast convolution algorithm for state space models","venue":"math.NA","work_id":"79b289bf-b553-4fa8-9d47-dc3cef961f25","year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.281610Z"},"links":{"cited_paper":"/paper/2411.17729","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:3a9bb8c1cac546b9b6bf13dbecf62ae730ee1f91dc687ddfc0c837a111c43de7","observation_id":"2abb0996-3904-4825-b787-9dc39954fbce","resolution":{"observed_at":"2026-08-15T21:49:30.975310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.285452Z","title":"Antisymmetricrnn: A dynamical system view on recurrent neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.285452Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:44a3f29d5e6e0ae894e033edd9b2ffc2caae2d9b408f82b15601f976fedea67c","observation_id":"e4a50004-7131-45e5-a1cf-c40499f88f24","resolution":{"observed_at":"2026-08-15T21:49:30.285452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.289177Z","title":"Entropy-sgd: Biasing gradient descent into wide valleys","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.289177Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:d9e6dab3a8a58902de263a5a00e0e40218cb43d0b86e49d016aeb2f5ea9d186a","observation_id":"c1350f73-d353-4a9b-9a57-3e09dc4c21a0","resolution":{"observed_at":"2026-08-15T21:49:30.289177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.292711Z","title":"Universal approximation to nonlinear operators by neural networks with arbitrary activation functions and its application to dynamical systems","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.292711Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:846b643f2cf6a24a5712cebe928d891d3fa896b58f054516cc1733152313152e","observation_id":"eec1d35d-1723-4fae-9cbc-90aaa5c703f0","resolution":{"observed_at":"2026-08-15T21:49:30.292711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.296267Z","title":"The loss surfaces of multilayer networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.296267Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:c6cd9bcaa8a6a0759b41eaf1e3260e8fa5607ce9959fbefe8971951cadbdccab","observation_id":"dcd418ef-973f-450d-aa16-34f0ddac6df9","resolution":{"observed_at":"2026-08-15T21:49:30.296267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.300256Z","title":"Rethinking attention with performers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.300256Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:ef5118af2783d62f7d70df41fc60e5fb134f84320e27c879cc850667bfefb718","observation_id":"270139dc-70e4-4a43-b982-5f4c30a43950","resolution":{"observed_at":"2026-08-15T21:49:30.300256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.304581Z","title":"Approximation by superpositions of a sigmoidal function","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.304581Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:eb30f6212cb23f65f7cd2c37424b5d46ab1b96cff7c3d4cbcb38c13b869aa1ec","observation_id":"40eff04e-482b-4928-b65c-dd1dae845cb2","resolution":{"observed_at":"2026-08-15T21:49:30.304581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.308447Z","title":"Self-stabilization: The implicit bias of gra- dient descent at the edge of stability.International Conference on Learning Representations, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.308447Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:0a519c816abd58766e163bd59a0d3a90f3eb30527f0dc456d23224fabef4bf61","observation_id":"b9c2eb3a-926d-48ee-8cb5-54bd00a4d862","resolution":{"observed_at":"2026-08-15T21:49:30.308447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-15T21:49:30.312487Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.312487Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:4ead0ac39c21b1a19f16596739822be1cbb386f49680c75432a6646b23d8dd5d","observation_id":"741873d2-7cbd-437f-b909-1a1fd5219d90","resolution":{"observed_at":"2026-08-15T21:49:30.312487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.316368Z","title":"Identifying and attacking the saddle point problem in high-dimensional non-convex optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.316368Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:ad4411ca275c907802f90083e72755d6f955f02579f6f19eb416c53ebf7cd1d5","observation_id":"b497f41c-0f78-4a83-afb8-98f65d3d3ac5","resolution":{"observed_at":"2026-08-15T21:49:30.316368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.320214Z","title":"Fast fourier transforms for nonequispaced data","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.320214Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:6fb0a1a0b11a95e34f0201cfcd960c502a2eec7040bdda68318b69b3079c75de","observation_id":"4d6baecd-d998-44ec-9a2d-095bafead285","resolution":{"observed_at":"2026-08-15T21:49:30.320214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.324107Z","title":"Lipschitz recurrent neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.324107Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:446f45c64178c14cc9703a5d31feef0698451b500439343862f7902088c3537c","observation_id":"aef937b6-c8b0-45fc-bc4e-822731f6285a","resolution":{"observed_at":"2026-08-15T21:49:30.324107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.327534Z","title":"Understanding the difficulty of training deep feedforward neural networks","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.327534Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:6a35e52534d59ed4a86b1a112f2978f7c90b0bf92212c13886992bf16a410f8a","observation_id":"fc673393-d64d-4f15-be83-8b72f706cf72","resolution":{"observed_at":"2026-08-15T21:49:30.327534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.331012Z","title":"Unlocking state-tracking in linear rnns through negative eigenvalues","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.331012Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:6c55ab665fe00911222720aa54415245da51e4dfd8c43cfdbf51c184dc09be40","observation_id":"db2f2bb4-96ca-47c0-83a0-af95e65b2e10","resolution":{"observed_at":"2026-08-15T21:49:30.331012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-15T21:49:30.334810Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.334810Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:7854aa55c571e38735734cda7d26dfa432628c2ad6127a01a52eff6165f288e1","observation_id":"8c7f0265-346c-48cf-9f4f-6299441c611d","resolution":{"observed_at":"2026-08-15T21:49:30.334810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.338603Z","title":"On the parameterization and initialization of diagonal state space models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.338603Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:749b537dbdc37f6a45e444139c09819f850d137e350736dbf5c7a921e6719d95","observation_id":"d813169c-49c8-4bcc-956f-1b903609a623","resolution":{"observed_at":"2026-08-15T21:49:30.338603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.342452Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.342452Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:f170a8de12a5367af4d6aa4039348ffd0db3295d9d8f0b6c144698a1ca344a31","observation_id":"f7078c03-fd72-485b-a437-e2c8a7d3723e","resolution":{"observed_at":"2026-08-15T21:49:30.342452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.345921Z","title":"Diagonal state spaces are as effective as structured state spaces","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.345921Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:e77e894b35aa5445b0ba1919849052d35af64c363614aa68ab34830969cc523b","observation_id":"d42e3001-6d14-4238-8f0f-5238c85e2b52","resolution":{"observed_at":"2026-08-15T21:49:30.345921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.349786Z","title":"Liquid structural state-space models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.349786Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:e03d78b43d0ccb17f8d130b0d749855c1bb79cf5e5751026fa3f5ed5887bf92f","observation_id":"7639d05e-b1bb-42c6-90d1-2ab9df7ca533","resolution":{"observed_at":"2026-08-15T21:49:30.349786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.353216Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.353216Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:7b7ab3b3c83d4bab37303ae7eec0948619d254023112611d14dcaef563748559","observation_id":"d06cc120-e07c-4b12-ad84-a2df7833b0c6","resolution":{"observed_at":"2026-08-15T21:49:30.353216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.357278Z","title":"Generalization error analysis for selective state-space models through the lens of attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.357278Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:d4af003485a3feb22882e5824f9223e912ed74b7570d6fcaadae250f9970eeeb","observation_id":"e8a9c5d3-9111-4c7d-9cc7-7d191f6f64c6","resolution":{"observed_at":"2026-08-15T21:49:30.357278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03231","last_updated":"2025-01-27T07:22:28Z","snapshot_observed_at":"2026-08-16T13:21:12.367610Z","submitted_at":"2024-09-05T03:57:28Z","title":"State-space models are accurate and efficient neural operators for dynamical systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03231","snapshot_observed_at":"2026-08-15T21:49:30.360718Z","title":"State-space models are accurate and efficient neural operators for dynamical systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.360718Z"},"links":{"cited_paper":"/paper/2409.03231","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:be2937192ed5213bb32433f32b79676ce04b0d863f559d771a3bbeed40fab1b4","observation_id":"cc921ff7-a238-4547-81db-2d0e9d26fd2e","resolution":{"observed_at":"2026-08-15T21:49:30.360718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.364830Z","title":"Hydra: Bidirectional state space models through generalized matrix mixers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.364830Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:86d109552d335478b008f3687c912f62b421123a6455927cb7b34404011a06c9","observation_id":"c5dfd83a-963e-4e97-8e63-5ac193424d25","resolution":{"observed_at":"2026-08-15T21:49:30.364830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.368952Z","title":"Jacot, F","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.368952Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:f5f8a8a50e0f7fe5c3ec000a9a69ce9f38317fdc12775dc6885b554a937d27da","observation_id":"8ce413f9-499e-495d-a5dc-6b7cd4c66eff","resolution":{"observed_at":"2026-08-15T21:49:30.368952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.372632Z","title":"A new approach to linear filtering and prediction problems","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.372632Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:be845b9de7a9b7c26a5ba4655a45ec73a92d700971602872f6b5c865b667ee45","observation_id":"96fec00f-fae4-44e9-b48c-0829aa476fe5","resolution":{"observed_at":"2026-08-15T21:49:30.372632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.376649Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.376649Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:3680ab9f6668f3e1ec28453ee9897ce2bc70ca1120cc22abe1d47554e50a41c9","observation_id":"da0c45ef-4184-41c0-a672-1426abe41d00","resolution":{"observed_at":"2026-08-15T21:49:30.376649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.505988Z","title":"On large-batch training for deep learning: Generalization gap and sharp minima","venue":null,"work_id":"2f173c73-d7fb-422e-b632-f8d2ea9dafe9","year":2017},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.379964Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:9df0501f8faaff16a9ff692dbf11f6322c08cd43e3cd4255120d51ec677c0f63","observation_id":"4e7064ee-fcf6-448a-bc77-0f5d37531f17","resolution":{"observed_at":"2026-08-15T21:49:31.511394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.08539","last_updated":"2020-06-08T14:08:06Z","snapshot_observed_at":"2026-08-14T16:29:09.584748Z","submitted_at":"2019-05-21T10:47:55Z","title":"Universal Approximation with Deep Narrow Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.08539","snapshot_observed_at":"2026-08-15T21:49:30.383291Z","title":null,"venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.383291Z"},"links":{"cited_paper":"/paper/1905.08539","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:2a2554893c02ca58d345e5a4afe36680adf5a394a843cf9d28d6a9db29c65e4c","observation_id":"059d51e2-fdf9-466e-8f4c-7983e15aa50e","resolution":{"observed_at":"2026-08-15T21:49:30.383291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.495803Z","title":"Exploring the loss landscape of regularized neural networks via convex duality","venue":null,"work_id":"2e229f86-0969-4067-a0ee-9953f43978fc","year":2025},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.387241Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:1fd2a092ee9567907a826a420c0785fe9b0b52a16599ed57b77762e0fe7738af","observation_id":"d7d46c35-aae2-4c7e-9eca-2e1fee4e3112","resolution":{"observed_at":"2026-08-15T21:49:31.499329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.486276Z","title":"Reformer: The efficient transformer","venue":null,"work_id":"44c82238-cc43-4f09-a9c2-594e87a5834e","year":2020},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.390996Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:9668c1df4e33e5a366dbc021336dd913d839cde9930992db0565eaa9d0fbf56e","observation_id":"ed287507-808b-4750-a7ea-07cb704c9390","resolution":{"observed_at":"2026-08-15T21:49:31.489576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.394447Z","title":"Visualizing the loss landscape of neural nets","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.394447Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:e9829dec9346b02b13a81e583ce734f704af8f7736985d47c47eb4f618e0b0db","observation_id":"bc839248-8138-43a2-90fe-9faa78606599","resolution":{"observed_at":"2026-08-15T21:49:30.394447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02063","last_updated":"2024-09-10T14:02:58Z","snapshot_observed_at":"2026-08-16T14:04:14.953751Z","submitted_at":"2024-04-02T16:04:31Z","title":"SPMamba: State-space model is all you need in speech separation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02063","snapshot_observed_at":"2026-08-15T21:49:30.398032Z","title":"Spmamba: State-space model is all you need in speech separation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.398032Z"},"links":{"cited_paper":"/paper/2404.02063","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:297d090dbc1100ff51e634592be16b97bfc01a50eea918eec76f8305149014b3","observation_id":"d9e0101f-8494-4dca-b333-c61317a3dbf3","resolution":{"observed_at":"2026-08-15T21:49:30.398032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.468603Z","title":"Videomamba: State space model for efficient video understanding","venue":null,"work_id":"6768464e-30d5-4cca-8bf2-7bab4057cdcb","year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.401630Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:7b56315728bea08a5aa1afcb848e8ee172de8420c1275152cd526578bb63fc69","observation_id":"b739569f-98fe-437b-9e00-a89d31eab676","resolution":{"observed_at":"2026-08-15T21:49:31.472372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.458450Z","title":"Jamba: A hybrid transformer-mamba language model","venue":null,"work_id":"b61bfed9-20bb-4ed7-938f-6bfe180e3bb6","year":2025},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.405272Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:b6cafb73e39893f0f9e00caeac4d47d67e7f2f333ad2835ae8c4be7ff8563060","observation_id":"fe558ccf-e2c1-40fd-89fe-0f33c0eabd67","resolution":{"observed_at":"2026-08-15T21:49:31.461991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02670","last_updated":"2024-05-04T13:58:03Z","snapshot_observed_at":"2026-08-16T13:55:25.109012Z","submitted_at":"2024-05-04T13:58:03Z","title":"From Generalization Analysis to Optimization Designs for State Space Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02670","snapshot_observed_at":"2026-08-15T21:49:30.408905Z","title":"From generalization analysis to optimization designs for state space models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.408905Z"},"links":{"cited_paper":"/paper/2405.02670","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:1f58342b6dee6bf411badec39a7e24e1e36efb5849e29448bb8b3139dea1b6ca","observation_id":"13da0156-e500-47e8-bbe4-71d941b3d841","resolution":{"observed_at":"2026-08-15T21:49:30.408905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.447723Z","title":"Autocorrelation matters: Understanding the role of initialization schemes for state space models","venue":null,"work_id":"4077777b-8587-4bfb-a829-3f97eadf4890","year":2025},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.412603Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:0257d5950ecc75758f489e8efdcd10fcb693dc2ed43c821c7234db2a999da24a","observation_id":"c0f7d985-ac72-4026-ad0d-0924729f48fa","resolution":{"observed_at":"2026-08-15T21:49:31.451947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.437612Z","title":"Sigma: Selective gated mamba for sequential recommenda- tion","venue":null,"work_id":"b3236c8b-7597-4567-83b6-0f86e7d3c0c5","year":2025},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.415932Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:6b8e453171b55355f7e42ffaafcd1f2735c19d598d0cc1e9cc7059c0e798c82b","observation_id":"181a103c-c55a-43d2-900d-1bb159d8f0bb","resolution":{"observed_at":"2026-08-15T21:49:31.441099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.426664Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":"a5ea0b1e-2c27-4483-a307-95b5ab0b2370","year":2017},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.419332Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:b56e9b2b9d4648522e0a43e5baa76ad76f36c681caf43727a321ff4832ef5fcb","observation_id":"d8a7dae3-c9c0-484e-b0f0-c8d37210af77","resolution":{"observed_at":"2026-08-15T21:49:31.430045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.422957Z","title":"Learning nonlinear operators via deeponet based on the universal approximation theorem of operators","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.422957Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:f83b7fdb4023c0a7581d24a5a24a28f451bfdbe555028b64c9e5034710dbb0d0","observation_id":"ca18c959-d4d0-4d17-92c1-97392d75d3a1","resolution":{"observed_at":"2026-08-15T21:49:30.422957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02941","last_updated":"2024-11-05T09:34:05Z","snapshot_observed_at":"2026-08-16T13:02:50.757364Z","submitted_at":"2024-11-05T09:34:05Z","title":"A Mamba Foundation Model for Time Series Forecasting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02941","snapshot_observed_at":"2026-08-15T21:49:30.426327Z","title":"A mamba foundation model for time series forecasting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.426327Z"},"links":{"cited_paper":"/paper/2411.02941","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:105acc5f0609028b95af40ef0cc7c93536aa6cd45c6055f91baa1913977f87c1","observation_id":"efce10ba-c865-4913-9786-aa897e891197","resolution":{"observed_at":"2026-08-15T21:49:30.426327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.429687Z","title":"A mean field view of the landscape of two-layer neural networks.Proceedings of the National Academy of Sciences, 115(33):E7665– E7671, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.429687Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:b635f8c217a4a88abc669639da30425f0be384dd78cf152efc8db505ea836cdd","observation_id":"8cce120a-67c6-464a-8098-4d33b1d3dd1c","resolution":{"observed_at":"2026-08-15T21:49:30.429687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.432944Z","title":"Theoretical foundations of deep selective state-space models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.432944Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:a02a93ea1872d865d7d00133f0dd277a9e8cc6bd01af052fa8b4a7d99ce0f86b","observation_id":"1d4a2556-3fd9-4463-9270-063aa906a67c","resolution":{"observed_at":"2026-08-15T21:49:30.432944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.436209Z","title":"A time series is worth 64 words: Long-term forecasting with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.436209Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:42132f3e532876320bf4110835ac3271d30a906ccc09b63b0996547a9a707801","observation_id":"de244fe1-5343-48e4-8fac-af164f75e2c7","resolution":{"observed_at":"2026-08-15T21:49:30.436209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06349","last_updated":"2023-03-11T08:53:11Z","snapshot_observed_at":"2026-08-16T15:49:03.576715Z","submitted_at":"2023-03-11T08:53:11Z","title":"Resurrecting Recurrent Neural Networks for Long Sequences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06349","snapshot_observed_at":"2026-08-15T21:49:30.439548Z","title":"Resurrecting recurrent neural networks for long sequences","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.439548Z"},"links":{"cited_paper":"/paper/2303.06349","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:679cd3a93ca599cb9f2d0f9aa75534b2082216723f8d132aa5c41f49d92d96a0","observation_id":"1f7d8887-8000-459d-a1f3-014ab2de6d97","resolution":{"observed_at":"2026-08-15T21:49:30.439548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.391565Z","title":"State-free inference of state-space models: The transfer function approach","venue":null,"work_id":"3faaf8c4-e29e-43f2-918c-7d992720e769","year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.443099Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:0cb8b90743ecbb696072fcdff3d9c52a21a25561cedf7d7eea29fb84bc838b0f","observation_id":"6e02c931-0297-4ee2-a7ef-e0a9d15f517e","resolution":{"observed_at":"2026-08-15T21:49:31.395368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.446414Z","title":"On the difficulty of training recurrent neural networks","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.446414Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:1cc7b65260a24cad2fd4e63f898c6e2a53f6242adb92e8df9ce033e1438a88f5","observation_id":"2ce66572-4fe9-484b-a905-75ee909a55a1","resolution":{"observed_at":"2026-08-15T21:49:30.446414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16112","last_updated":"2024-04-24T18:10:31Z","snapshot_observed_at":"2026-08-16T13:58:07.719517Z","submitted_at":"2024-04-24T18:10:31Z","title":"Mamba-360: Survey of State Space Models as Transformer Alternative for Long Sequence Modelling: Methods, Applications, and Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16112","snapshot_observed_at":"2026-08-15T21:49:30.450813Z","title":"Mamba-360: Survey of state space models as transformer alternative for long sequence modelling: Methods, applications, and challenges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.450813Z"},"links":{"cited_paper":"/paper/2404.16112","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:0653ee93db0b81137fec70f60faad95ea512cda51f6e6ca9ced88cc76bf70179","observation_id":"9c34ba97-dd5b-4700-b233-a5db00347e48","resolution":{"observed_at":"2026-08-15T21:49:30.450813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.374903Z","title":"Let SSMs be ConvNets: State-space modeling with optimal tensor contractions","venue":null,"work_id":"b46dd456-a543-408c-be57-eb08453d6540","year":2025},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.454372Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:80b4009fe7ae6a060283948d2715c54ac0f6d5562e2d9593a99be4145e455e6d","observation_id":"1d5d5414-b918-4fdb-89bc-2eb4024c6ca5","resolution":{"observed_at":"2026-08-15T21:49:31.378385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.362581Z","title":"Approximation theory of the mlp model in neural networks","venue":null,"work_id":"f21d6630-d94d-4f11-a4e6-d86c5919beea","year":1999},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.457921Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:27dc0649b7657f558b0664641b1de6d56d53da085e8b35538ef4884c4a7aae36","observation_id":"99352441-95c0-49bf-b972-1ee31b53f430","resolution":{"observed_at":"2026-08-15T21:49:31.366961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.352383Z","title":"S4++: Elevating long sequence modeling with state memory reply","venue":null,"work_id":"8964f29e-d523-4a2c-8c13-f591792027f1","year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.461656Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:be203098e589dd49319b1c29896b8224d12591ca6391668676f50508dab3dcfd","observation_id":"4f0f236f-e902-4d59-a642-f8e40f363263","resolution":{"observed_at":"2026-08-15T21:49:31.356019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13600","last_updated":"2024-03-20T13:48:50Z","snapshot_observed_at":"2026-08-16T14:08:01.486505Z","submitted_at":"2024-03-20T13:48:50Z","title":"VL-Mamba: Exploring State Space Models for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13600","snapshot_observed_at":"2026-08-15T21:49:30.464971Z","title":"Vl-mamba: Exploring state space models for multimodal learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.464971Z"},"links":{"cited_paper":"/paper/2403.13600","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:001b1ed707b0859a133b642556484bde4b98600cce3fbc24268793468fb46e55","observation_id":"d5a9868d-4169-4c77-be4e-24fbca4d218a","resolution":{"observed_at":"2026-08-15T21:49:30.464971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10669","last_updated":"2025-04-14T19:45:07Z","snapshot_observed_at":"2026-08-17T03:28:30.105392Z","submitted_at":"2025-04-14T19:45:07Z","title":"Perturbed State Space Feature Encoders for Optical Flow with Event Cameras","version":1},"cited_work":{"arxiv_id":"2504.10669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.10669","snapshot_observed_at":"2026-08-15T21:49:30.787088Z","title":"Perturbed State Space Feature Encoders for Optical Flow with Event Cameras","venue":"cs.CV","work_id":"fef9131a-f26d-4621-bdfa-3a9c9fa1cc54","year":2025},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.468537Z"},"links":{"cited_paper":"/paper/2504.10669","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:4c8dadc99303643ef864cd31b94a08cc4a0cf60dad428f364186988753b73d34","observation_id":"78f9438b-5176-45eb-b180-f75c800dca1a","resolution":{"observed_at":"2026-08-15T21:49:30.790983Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.471941Z","title":"Provable benefits of complex parameterizations for structured state space models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.471941Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:7d3f6902c08f32af02b8f047a5e30eefea56cdb4384acacd4f0ceab699edec13","observation_id":"49626bcd-1a95-42f8-ab40-8afa729be7b6","resolution":{"observed_at":"2026-08-15T21:49:30.471941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11729","last_updated":"2025-01-20T20:27:50Z","snapshot_observed_at":"2026-08-18T10:07:30.191841Z","submitted_at":"2025-01-20T20:27:50Z","title":"SeRpEnt: Selective Resampling for Expressive State Space Models","version":1},"cited_work":{"arxiv_id":"2501.11729","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.11729","snapshot_observed_at":"2026-08-15T21:49:30.771917Z","title":"SeRpEnt: Selective Resampling for Expressive State Space Models","venue":"cs.LG","work_id":"dbe373fb-6f4a-4e6a-b898-055066c817c6","year":2025},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.475278Z"},"links":{"cited_paper":"/paper/2501.11729","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:7636f4c46d1a1250a70aa44d102ba79d5b616145440a5d2fa9c5671b1c563611","observation_id":"326a9f59-393e-4025-b6de-5fe5c7dd9090","resolution":{"observed_at":"2026-08-15T21:49:30.776274Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.334198Z","title":"Ckconv: Continuous kernel convolution for sequential data","venue":null,"work_id":"4280d988-060b-441a-bb0e-c976906ae6f2","year":2022},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.478885Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:b57902325b28142f990f5da4844a0c9dceed8a818e9273f2e8a9ff76a094304f","observation_id":"1a99fc75-c0d0-4f0c-a6f6-97c539d1d248","resolution":{"observed_at":"2026-08-15T21:49:31.337955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.323226Z","title":"Trainability and accuracy of artificial neural networks: An interacting particle system approach","venue":null,"work_id":"d83845e3-f52e-4d86-a761-1f38b345ad75","year":1935},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.482105Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:aac324a0494af5a72d0373692bd39ef9a341f50bc9bbd07ba1789881dcf78fce","observation_id":"a0f25cf8-5165-4f3c-a5a9-28ef3e928ac2","resolution":{"observed_at":"2026-08-15T21:49:31.326879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.312458Z","title":"Unicornn: A recurrent model for learning very long time dependencies","venue":null,"work_id":"53cfcc49-0092-4f4e-ad6c-50c472df1f72","year":2021},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.485470Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:abf2dcfb8c43d7ae4e718775482cd3ec3a995123cb96ed735e9402c342405016","observation_id":"c021b988-27fa-434b-a7d9-08e4cf101365","resolution":{"observed_at":"2026-08-15T21:49:31.316415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.301662Z","title":"Oscillatory state-space models","venue":null,"work_id":"7f1d4fdb-2559-4acd-8f24-cdfb4295ead3","year":2025},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.488861Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:cfa1080fe861df050d456f46a237e25556d61a3766c3867285ef298871289007","observation_id":"4796b129-afa5-4694-bebf-b73da4910411","resolution":{"observed_at":"2026-08-15T21:49:31.305413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.04454","last_updated":"2018-05-07T15:43:39Z","snapshot_observed_at":"2026-08-17T17:22:50.487571Z","submitted_at":"2017-06-14T12:50:00Z","title":"Empirical Analysis of the Hessian of Over-Parametrized Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.04454","snapshot_observed_at":"2026-08-15T21:49:30.492533Z","title":"Empirical anal- ysis of the hessian of over-parametrized neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.492533Z"},"links":{"cited_paper":"/paper/1706.04454","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:c89dd3a99894c21f26ae51048cee98d4e58d5d4d1cef89fc3018a2bfe833ac12","observation_id":"b48629b0-3f76-48f4-ab0b-c8d9a4b3693d","resolution":{"observed_at":"2026-08-15T21:49:30.492533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.289857Z","title":"Recurrent neural networks are universal approximators","venue":null,"work_id":"cea12e9b-35a7-4f6c-affc-a738346e57b0","year":2006},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.495969Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:964b9069d4f71d24c52f9f6dcdfef6c8440fec9386018c5365c33aa942112506","observation_id":"4b956a55-396e-46d8-8f79-9b62252ddc24","resolution":{"observed_at":"2026-08-15T21:49:31.294602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.278834Z","title":"SpikingSSMs: Learning long sequences with sparse and 17 parallel spiking state space models","venue":null,"work_id":"34f039dc-9934-45f5-8bca-9d7915df8481","year":2025},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.498990Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:eb72a6fbf8a69d19ffc3ab66d6648002b6ab6016f7c67d0f14daed603262207c","observation_id":"0f70efda-c7e8-41ea-8f1a-16313efeebe9","resolution":{"observed_at":"2026-08-15T21:49:31.282508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.502789Z","title":"Learning important features through propagating activation differences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.502789Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:ce457ea7e20b8e19d1a362150d9da4b8980affb791bcd0d2d91513fd31ddfffc","observation_id":"5e347c4b-e5f9-4ab0-a535-4084ff002245","resolution":{"observed_at":"2026-08-15T21:49:30.502789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.262006Z","title":"Understanding the differences in foundation models: Attention, state space models, and recurrent neural networks","venue":null,"work_id":"708c706e-30d1-41d7-855a-b66b279684da","year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.506519Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:aa3aa5b2f77bcf5cff37c50568b724617bdf62db85957bbe77bc51cba80ee188","observation_id":"6ee8699f-c502-45f7-9023-b107c94edaa4","resolution":{"observed_at":"2026-08-15T21:49:31.266072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.250813Z","title":"Deep inside convolutional net- works: Visualising image classification models and saliency maps","venue":null,"work_id":"a17888b6-9c13-4848-ab2a-768130a7d0e9","year":2014},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.509970Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:716b1f70eadd64ac17478270796c714867aaa8659c622cee03be01940afa2e67","observation_id":"c1d41373-63e6-473d-9341-1a8115c606ca","resolution":{"observed_at":"2026-08-15T21:49:31.254435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07279","last_updated":"2024-07-10T00:01:56Z","snapshot_observed_at":"2026-08-16T13:35:36.685688Z","submitted_at":"2024-07-10T00:01:56Z","title":"Towards a theory of learning dynamics in deep state space models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07279","snapshot_observed_at":"2026-08-15T21:49:30.513445Z","title":"Towards a theory of learning dynamics in deep state space models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.513445Z"},"links":{"cited_paper":"/paper/2407.07279","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:219fb22ebd807f46e2030fd079eed147f59f5b8c198635592ce8f874935f85f5","observation_id":"999523ec-8554-4f8d-8fb1-964684819c74","resolution":{"observed_at":"2026-08-15T21:49:30.513445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.516954Z","title":"Smith, Andrew Warrington, and Scott Linderman","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.516954Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:f87dfe646445daab0b123a6a56f313dad4e0f33466ebcd88c6633778c76d936a","observation_id":"d25f5f6a-762d-4af8-b86b-b003b991e8ba","resolution":{"observed_at":"2026-08-15T21:49:30.516954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.520236Z","title":"SlimPajama: A 627B token cleaned and deduplicated version of RedPajama, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.520236Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:5978ac7f8722e499755bc724c8c61a029cec55dd6615f90a59cbcaa944eb86d0","observation_id":"5f4118e2-878d-4af9-9ed7-b69344243786","resolution":{"observed_at":"2026-08-15T21:49:30.520236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03464","last_updated":"2024-10-04T14:27:43Z","snapshot_observed_at":"2026-08-16T13:12:33.851008Z","submitted_at":"2024-10-04T14:27:43Z","title":"S7: Selective and Simplified State Space Layers for Sequence Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03464","snapshot_observed_at":"2026-08-15T21:49:30.523844Z","title":"S7: Selective and simplified state space layers for sequence modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.523844Z"},"links":{"cited_paper":"/paper/2410.03464","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:e879c684a5639a28ef54b29a6a8add0923c5ec4e0c3a29edb17491ff042128fe","observation_id":"95b9d120-f626-4e01-8960-ee1ed5a7790d","resolution":{"observed_at":"2026-08-15T21:49:30.523844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.227575Z","title":"A survey on statistical theory of deep learning: Approxi- mation, training dynamics, and generative models","venue":null,"work_id":"07a8df9b-7b44-4b3a-aa2c-f10df0acacb5","year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.527500Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:c9133733765ad7b157528c74c5acfd0156b56f1df8a37fa73bcbeb01d5f1a62a","observation_id":"3126ce1c-38a8-469c-9279-89814d909b5e","resolution":{"observed_at":"2026-08-15T21:49:31.231559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.530733Z","title":"Axiomatic attribution for deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.530733Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:84d19da3a99c048f35f32dcc7e3b7659041a78cc9d27329ca9a115ec100a6657","observation_id":"94408771-01d0-4163-926b-03da4bc718bc","resolution":{"observed_at":"2026-08-15T21:49:30.530733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.210099Z","title":"Benefits of depth in neural networks","venue":null,"work_id":"8ee0b961-8e08-49bd-b5ec-38e9995bb916","year":2016},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.534005Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:28d298ed851a5e013adf8323c9efac441fe0f08e7e02297c40493aedab4ff911","observation_id":"b7f4fd80-4ede-4477-b93c-5f02d54d4561","resolution":{"observed_at":"2026-08-15T21:49:31.214185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.537213Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.537213Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:10079a0f53f0095287d8c0fbf2732744f8578e6b5d51275f18fb1ce1c876e0b7","observation_id":"840ce248-1f72-4527-be45-ceef5b6b325f","resolution":{"observed_at":"2026-08-15T21:49:30.537213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07887","snapshot_observed_at":"2026-08-15T21:49:30.540419Z","title":"An empirical study of mamba-based language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.540419Z"},"links":{"cited_paper":"/paper/2406.07887","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:622555592bd56b5f5b71d1c79b3be45f35497dbc9de723693f79a61c579f21ca","observation_id":"68fc5b94-16ff-4a7a-8054-e9f36408cbb4","resolution":{"observed_at":"2026-08-15T21:49:30.540419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03484","last_updated":"2025-05-06T12:40:38Z","snapshot_observed_at":"2026-08-18T10:52:40.269601Z","submitted_at":"2025-05-06T12:40:38Z","title":"STAR-Rec: Making Peace with Length Variance and Pattern Diversity in Sequential Recommendation","version":1},"cited_work":{"arxiv_id":"2505.03484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.03484","snapshot_observed_at":"2026-08-15T21:49:30.721203Z","title":"STAR-Rec: Making Peace with Length Variance and Pattern Diversity in Sequential Recommendation","venue":"cs.IR","work_id":"40a324f5-ef42-454d-ac09-d1dea8d7f275","year":2025},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.543930Z"},"links":{"cited_paper":"/paper/2505.03484","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:702e18a5ab497a92609b439cfda158fbe486651b66f4e81fbd67d539ebbd7a34","observation_id":"91d8c88e-5d03-4e30-9eee-acafb237e014","resolution":{"observed_at":"2026-08-15T21:49:30.725254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14495","last_updated":"2024-06-05T05:15:16Z","snapshot_observed_at":"2026-08-17T15:42:07.928550Z","submitted_at":"2023-11-24T14:08:31Z","title":"StableSSM: Alleviating the Curse of Memory in State-space Models through Stable Reparameterization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14495","snapshot_observed_at":"2026-08-15T21:49:30.547490Z","title":"StableSSM: Alleviating the curse of memory in state-space models through stable reparameterization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.547490Z"},"links":{"cited_paper":"/paper/2311.14495","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:7d79f639dbf1379f2a2485489c1836a0f8c92d23708e353d6b23b81beb71bf19","observation_id":"bdf23c0f-e172-4d29-a469-50f29b7b9279","resolution":{"observed_at":"2026-08-15T21:49:30.547490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.192742Z","title":"State-space models with layer-wise nonlinearity are universal approximators with exponential decaying memory","venue":null,"work_id":"c04e99ad-47ec-4993-887f-d3ebc150c60b","year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.553981Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:7f27587c28c565b9391a11021e8931f7bc0ffdca84778d5fac73b3a7e04100e7","observation_id":"224e0b80-38df-4220-8f88-a6646f9b2150","resolution":{"observed_at":"2026-08-15T21:49:31.196557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09516","last_updated":"2024-04-15T07:24:45Z","snapshot_observed_at":"2026-08-16T14:00:57.645590Z","submitted_at":"2024-04-15T07:24:45Z","title":"State Space Model for New-Generation Network Alternative to Transformers: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09516","snapshot_observed_at":"2026-08-15T21:49:30.557268Z","title":"State space model for new-generation network alternative to transformers: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.557268Z"},"links":{"cited_paper":"/paper/2404.09516","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:ec266816715489768c2caab48bce9e025f1394502534d915dded443b1a69f7d8","observation_id":"f4e0f38e-e220-419b-b05b-d935a07ac5bf","resolution":{"observed_at":"2026-08-15T21:49:30.557268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14980","last_updated":"2025-01-24T23:31:42Z","snapshot_observed_at":"2026-08-14T14:44:24.342248Z","submitted_at":"2025-01-24T23:31:42Z","title":"A Deep State Space Model for Rainfall-Runoff Simulations","version":1},"cited_work":{"arxiv_id":"2501.14980","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.14980","snapshot_observed_at":"2026-08-15T21:49:30.685346Z","title":"A Deep State Space Model for Rainfall-Runoff Simulations","venue":"cs.LG","work_id":"b0e59849-bbd4-4669-871f-86b10fe8b075","year":2025},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.561262Z"},"links":{"cited_paper":"/paper/2501.14980","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:09d834b75a0f27e3bf2d66d792e6e5eb14c1a102c67f30a7500e3e73199acce2","observation_id":"a95c8129-a7e9-49be-aa05-6ca47f2c7040","resolution":{"observed_at":"2026-08-15T21:49:30.691078Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:30.564650Z","title":"Is mamba effective for time series forecasting? Neurocomputing, 619:129178, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.564650Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:8f5245de6bb62a1cb286540091acf583f118046912c869b1589736bbc7198940","observation_id":"f8bc417e-031d-405a-9257-30326bd54e07","resolution":{"observed_at":"2026-08-15T21:49:30.564650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.175298Z","title":"A superfast direct inversion method for the nonuniform discrete fourier transform","venue":null,"work_id":"7db2255a-8dd6-4855-9982-faa5864122a8","year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.567946Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:01b6c20008cb93de0ae34871ec5eafa63c33efa7edad08004909a7a785ea1580","observation_id":"7dd15174-d0f1-4bf9-99ba-efab6ff154eb","resolution":{"observed_at":"2026-08-15T21:49:31.179008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.164224Z","title":"Disentangling trainability and generalization in deep neural networks","venue":null,"work_id":"9df442aa-9351-4dbe-86cf-1c2e57d7def6","year":2020},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.571006Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:ddf70b2faf53b284677f9b35e8293efee6b4f841d3797095ce22247b2311ce40","observation_id":"515c5a71-cb9a-4146-b765-9d1ab3156998","resolution":{"observed_at":"2026-08-15T21:49:31.168176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09807","last_updated":"2024-11-14T20:46:26Z","snapshot_observed_at":"2026-08-16T10:20:51.914539Z","submitted_at":"2024-11-14T20:46:26Z","title":"Evaluating Loss Landscapes from a Topology Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09807","snapshot_observed_at":"2026-08-15T21:49:30.574330Z","title":"Evaluating loss landscapes from a topology perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.574330Z"},"links":{"cited_paper":"/paper/2411.09807","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:5db6d3e71cb8ad42a62a3219f00694e6878927936f2bb89cd38ec8844bb2067c","observation_id":"c6e328ea-9a60-4f12-b122-1b681f843f87","resolution":{"observed_at":"2026-08-15T21:49:30.574330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.14522","last_updated":"2022-07-15T17:04:24Z","snapshot_observed_at":"2026-08-18T09:46:54.696672Z","submitted_at":"2020-11-30T03:21:05Z","title":"Feature Learning in Infinite-Width Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.14522","snapshot_observed_at":"2026-08-15T21:49:30.577694Z","title":"Feature learning in infinite-width neural networks","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.577694Z"},"links":{"cited_paper":"/paper/2011.14522","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:9a5b289b06bc18433dff18630512f14ea9ba560bf0045aed7423717428bdac55","observation_id":"7df5373f-e590-47ae-a9a4-96701ab351bc","resolution":{"observed_at":"2026-08-15T21:49:30.577694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.151279Z","title":"Longmamba: Enhancing mamba’s long-context capabilities via training-free receptive field enlargement","venue":null,"work_id":"f4130566-6d93-40d3-a100-478ed3cbbdd3","year":2025},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.580941Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:7ca4b80cc962dae38431a1c0f58e98e14c4c21f187f3f811084d788d187124cd","observation_id":"fbfc1fe1-8ad9-448e-9e16-0b4026b93d18","resolution":{"observed_at":"2026-08-15T21:49:31.156045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11354","last_updated":"2021-09-23T13:03:53Z","snapshot_observed_at":"2026-08-18T03:04:21.657400Z","submitted_at":"2021-09-23T13:03:53Z","title":"Arbitrary-Depth Universal Approximation Theorems for Operator Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.11354","snapshot_observed_at":"2026-08-15T21:49:30.584095Z","title":"Arbitrary-depth universal approximation theorems for operator neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.584095Z"},"links":{"cited_paper":"/paper/2109.11354","citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:d1a6bf61a8ececf332a2e869a64d011c7cb9d9f93393f362bfed48a45943f0be","observation_id":"a051064b-d0e2-45e7-a2fd-6c86fca18b88","resolution":{"observed_at":"2026-08-15T21:49:30.584095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.139062Z","title":"Tuning frequency bias of state space models","venue":null,"work_id":"c919a183-446e-466e-a8f2-590e4716f2a4","year":2025},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.587907Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:45a72570eae935c1340f98e88a7eb8c5ab59ffa069ede26c6d1d934addd881c3","observation_id":"dc912768-fcee-4ce5-a710-403bd9f54344","resolution":{"observed_at":"2026-08-15T21:49:31.143335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.127106Z","title":"HOPE for a robust pa- rameterization of long-memory state space models","venue":null,"work_id":"dbefed97-c804-4c6c-b92c-f540ca68c5d4","year":2025},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.591148Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:736cc30da04f8267e32415ac7ab5b518486b7e30c2a28ff0b90a6360c46aeb95","observation_id":"ce2302f9-f432-448f-b526-78a344f13e55","resolution":{"observed_at":"2026-08-15T21:49:31.130991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.116090Z","title":"Mahoney, and N","venue":null,"work_id":"bff2c5ef-86f1-4c78-9470-de2ac89fea0e","year":2024},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.594805Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:d246407dd992ca4f0400d9c0a085d1953b7c01fed39f249e534e73ad1d7e4eb6","observation_id":"0d7034ba-99e4-4e48-9f87-6240ca8eb930","resolution":{"observed_at":"2026-08-15T21:49:31.119648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:49:31.105627Z","title":"On the stability of unevenly spaced samples for interpolation and quadrature","venue":null,"work_id":"9bb5f31e-ab32-4046-a871-d44d17b29915","year":2023},"citing_paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:30.598041Z"},"links":{"citing_paper":"/paper/2505.09022"},"observation_digest":"sha256:15aee37dcb2ae579427b0cd1574983ae7d1718ba5bf566061a51154599d62ff9","observation_id":"a69fe337-c6df-4ed9-9bc8-e567140a9702","resolution":{"observed_at":"2026-08-15T21:49:31.109440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.09022","last_updated":"2025-05-13T23:34:09Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T00:12:19.683404Z","submitted_at":"2025-05-13T23:34:09Z","title":"Block-Biased Mamba for Long-Range Sequence Processing"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":5,"verified_fuzzy":30},"total_outbound_references":108},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 108 outbound references and 3 inbound Pith citation observations for arXiv:2505.09022."}