{"as_of":"2026-08-23T09:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8ecb25536abea02e29cae736ca6344cfb04abdcebca08ef7742cf56db94639eb","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:09:51.180396Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.16624/citation-record","integrity":"/paper/2507.16624/integrity","json":"/paper/2507.16624/citation-record.json","paper":"/paper/2507.16624"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.580524Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"761c4588-68cb-4e6f-b99d-6dc53ec8e3a0","year":2021},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:41.911512Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:0176d2daa7aa9d2919c294018f4b1039fc2d814f7d40c01bb213e22c9146e46b","observation_id":"ba1fdd7c-b8ef-4ae5-b875-624c69aac48e","resolution":{"observed_at":"2026-08-06T15:09:52.587508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:50.764415Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.764415Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:b3e65b070523909bc25d35f9050c6d53176680f3704fd03e50adcde1ea34c7ab","observation_id":"9fd7222a-87d3-49fc-ae91-5ee4fd5d73b3","resolution":{"observed_at":"2026-08-06T15:09:50.764415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.544613Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":"0d02ae99-fe15-4b26-9afe-a24031725334","year":2021},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.772564Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:c9448e914cf1f5268b0b530a07dbf53dd95b456b3b2f02b776c1737b5d5d3632","observation_id":"5a0c9534-c898-4c96-ae12-cde4dc06bb54","resolution":{"observed_at":"2026-08-06T15:09:52.553586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.525366Z","title":"Cswin transformer: A general vision transformer back- bone with cross-shaped windows,","venue":null,"work_id":"fe2576a5-0d65-4104-b567-c688931ba63b","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.779726Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:234b3fec528ad82227a65bfb3aaf415ea5aefcb1955569c5b13aef525dbc154d","observation_id":"91e928d6-afbe-4b30-bf04-4f5c6f7c0741","resolution":{"observed_at":"2026-08-06T15:09:52.530805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.504921Z","title":"Neighborhood attention transformer,","venue":null,"work_id":"b7174bfd-f062-436d-81de-6dc0b241ceff","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.790747Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:afb4235b18aefe749ffe0e4befea24425cdb4d589b855a003bf7ea9cef234eb4","observation_id":"90bb7a0d-0293-48c4-a2cf-ad55cc744dcd","resolution":{"observed_at":"2026-08-06T15:09:52.511526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.483902Z","title":"Biformer: Vi- sion transformer with bi-level routing attention,","venue":null,"work_id":"53cd8129-8e77-412b-8c3c-96bf72575003","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.801983Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:715e2f481a1d04946a9c818f1c74a3583d3c381bbb57783035a7fe08313c93c9","observation_id":"e194ed73-7e65-44b9-aa32-fb0e5c0e8b24","resolution":{"observed_at":"2026-08-06T15:09:52.490935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.467215Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without convolutions,","venue":null,"work_id":"9ef43889-3ae9-448a-9165-55905cb41314","year":2021},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.813550Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:bd7a3f33d66d33c50152b738255c7dac0ff003d9c4d5316dbf4c4d563da7e776","observation_id":"69600ac6-8669-4edd-89a7-9e1767173642","resolution":{"observed_at":"2026-08-06T15:09:52.472142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.450831Z","title":"Pvt v2: Improved baselines with pyramid vision transformer,","venue":null,"work_id":"e7b972cb-1893-48d0-81cf-ed99a0cdf995","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.822220Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:c266cf6355d22889cb67eafd3e31dcd4c691a1c088e0fb6262bb2da6e7ea3bb9","observation_id":"48ea8bfe-c03a-46a9-b463-4c3e6dc5c8fc","resolution":{"observed_at":"2026-08-06T15:09:52.456654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.431564Z","title":"P2t: Pyramid pool- ing transformer for scene understanding,","venue":null,"work_id":"da111e34-ed07-40eb-b3f3-e127b9672d14","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.828936Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:18c1e7de0efdb5ed1baae123155901f684d5ae2a46109b2a2c6bbd5a2fa35000","observation_id":"42af6379-759d-4df4-a9ba-3f52adeea1f4","resolution":{"observed_at":"2026-08-06T15:09:52.438189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.410389Z","title":"Maxvit: Multi-axis vision transformer,","venue":null,"work_id":"982510a2-2b32-4463-a1c1-b24fc4e6a94d","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.836228Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:1c0bdfb73552af2d33374eb2129c2d145a21265beff6fe17a6526cbc810aa699","observation_id":"e2a9d607-f532-44de-be37-c92db3b21012","resolution":{"observed_at":"2026-08-06T15:09:52.416711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15001","last_updated":"2023-01-16T18:58:58Z","snapshot_observed_at":"2026-08-16T16:28:04.474972Z","submitted_at":"2022-09-29T17:57:08Z","title":"Dilated Neighborhood Attention Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15001","snapshot_observed_at":"2026-08-06T15:09:50.841599Z","title":"Dilated neighborhood attention trans- former,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.841599Z"},"links":{"cited_paper":"/paper/2209.15001","citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:1a8525426c43ddf02ccb97f98daa07f93c966300bb4d05cc6a0bc009b18df332","observation_id":"425f7171-96a9-4ff0-bf45-25fcb391a43f","resolution":{"observed_at":"2026-08-06T15:09:50.841599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.391665Z","title":"Crossformer++: A versatile vision transformer hinging on cross-scale attention,","venue":null,"work_id":"71576667-de5e-4872-b1a7-8adde138c9e5","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.849000Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:0f54045b90dfb3905533179441afe5aab37e71b7a306c10a2b7f8dcd970d8fd2","observation_id":"eb1f1f34-e488-40a4-a43d-61924b7f96db","resolution":{"observed_at":"2026-08-06T15:09:52.397720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.373656Z","title":"Mamba: Linear-time sequence modeling with selective state spaces,","venue":null,"work_id":"bc4c2ba9-d53d-47bb-bf0f-4e48ac0bfb15","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.854165Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:a82a28b5071527d273df58732f357b02749419121e084e13c67f74c9c750dd49","observation_id":"972e4b1f-57f5-4cff-a704-5540e80333e5","resolution":{"observed_at":"2026-08-06T15:09:52.378973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.356343Z","title":"Vision mamba: Efficient visual representation learning with bidirectional state space model,","venue":null,"work_id":"4d2fb65e-c565-4033-99ef-dd9e6b2a7bec","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.859331Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:46a467781f9a835762da9c2d681f3313a34dbc2f854f21c770540f677127093c","observation_id":"fda5f9af-b025-4671-8c11-1e061f9781c6","resolution":{"observed_at":"2026-08-06T15:09:52.362085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.338688Z","title":"Vmamba: Visual state space model,","venue":null,"work_id":"5a53ba0f-a742-4049-babc-cd08a8bd20ca","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.864490Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:0aea391f72ff3717c1db4b8814784a73e06894b8ccc9d5cdf8d76beb9c91b3d4","observation_id":"f7038946-8832-44ce-a7f3-0e16ff3b39b0","resolution":{"observed_at":"2026-08-06T15:09:52.343974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.318196Z","title":"Local- mamba: Visual state space model with windowed selective scan,","venue":null,"work_id":"427ff6e8-f705-4328-a200-cabf836ed788","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.869967Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:e95339f9126156b41bd9f3c3ad4bdfe5cf4eec47712bd242e0e8b6c5fe0b8e89","observation_id":"ef7d6c22-1b9c-4e94-b8d7-c9937863cd15","resolution":{"observed_at":"2026-08-06T15:09:52.326198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.297165Z","title":"Plainmamba: Improving non-hierarchical mamba in visual recognition,","venue":null,"work_id":"1319f781-c522-43b6-b174-07e9b39a6966","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.875035Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:eff496ecf4951285a2c22ec9077730ce6bd164fe217611fc8e6d006cb88d92af","observation_id":"23405231-0106-4be3-aa04-624a87bafbdb","resolution":{"observed_at":"2026-08-06T15:09:52.302606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.279982Z","title":"Efficientvmamba: Atrous selective scan for light weight visual mamba,","venue":null,"work_id":"5d028ca2-0ec0-49b5-b18b-d1ec8a6334c6","year":2025},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.880636Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:3b092a7cd85675035583e9e0f29ec2a741b2af16e082544cb2995a7d3f399e5a","observation_id":"d6351ae5-d90f-4a5a-ba72-e57c5cba56d4","resolution":{"observed_at":"2026-08-06T15:09:52.285332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.261781Z","title":"Spatial- mamba: Effective visual state space models via structure-aware state fusion,","venue":null,"work_id":"3a3d2ac0-45ef-4e45-b688-ce8765f98e27","year":2025},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.885483Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:b18a49003ecc8d9ab5204d334c01f0b9be3a6b63038f01de8edd78d11171feb3","observation_id":"5d5a3d7c-0e70-4714-bcc4-b83f500f290f","resolution":{"observed_at":"2026-08-06T15:09:52.268053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.244398Z","title":"Sparx: A sparse cross-layer connec- tion mechanism for hierarchical vision mamba and transformer networks,","venue":null,"work_id":"a2cee3f7-78e6-4337-acc2-15645aed1182","year":2025},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.889642Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:6a8f23f52a80e978c9af0434d321d11abc5eec996d0d83a9f718527826a5d5f4","observation_id":"ca6aa5af-2f29-47b1-a327-38d439e0e016","resolution":{"observed_at":"2026-08-06T15:09:52.250146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.229053Z","title":"Mambaout: Do we really need mamba for vision?,","venue":null,"work_id":"6db75a6f-0585-4aed-89bb-16c2c8155714","year":2025},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.894039Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:fd5356312ef58831d1c61b66fb9a90484add64e3ce68d40d1f9ae67c3c008d4a","observation_id":"f8bdf14b-006b-4c1d-9e15-d4a510ae5670","resolution":{"observed_at":"2026-08-06T15:09:52.234059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.209857Z","title":"Mambavision: A hybrid mamba- transformer vision backbone,","venue":null,"work_id":"e08946bb-c3c6-4c28-920b-94abab8bb255","year":2025},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.898492Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:0d3028fbc1553490767576f90d9cb8b512d5a7731a59090003d5c2d4d01f8ad0","observation_id":"6368990a-c1ab-47c8-b502-0282822c9fcf","resolution":{"observed_at":"2026-08-06T15:09:52.216562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.190602Z","title":"Demystify mamba in vision: A linear attention perspective,","venue":null,"work_id":"97d18e3b-043b-4f1a-a895-baa13098129f","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.903379Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:94b6541825df1297e2ce3a1b0f203d3b0c0947f72622bf49976704322a94a47a","observation_id":"6a5ba455-6841-4422-a19f-c1a49a949798","resolution":{"observed_at":"2026-08-06T15:09:52.197316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.174422Z","title":"Metaformer baselines for vision,","venue":null,"work_id":"6e02c214-19f9-4dc0-a579-7ee4aca4757d","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.908617Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:ed19885d98a0b6a044538779ff7ba1c48c6a219917ab16fe3d9c3129aee62181","observation_id":"b55cebee-0fea-45c4-9841-54e174216143","resolution":{"observed_at":"2026-08-06T15:09:52.179234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.155723Z","title":"Rmt: Retentive networks meet vision transformers,","venue":null,"work_id":"dc4accba-4bca-407e-a74f-a478ac268e31","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.912995Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:871188ab8d99fa2be5ec277fbbb1539bcbfc09ae5d49540b143d6df35288fedc","observation_id":"c1f11d95-901e-4b9e-a2cb-7e116bb1f065","resolution":{"observed_at":"2026-08-06T15:09:52.161542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.139325Z","title":"Transnext: Robust foveal visual perception for vision transformers,","venue":null,"work_id":"8c49acbb-cc2e-4648-bf4c-fce1a5aab39b","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.917535Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:bbc3dda6ed642cbd6a903062b0105356c89b89906e465616e1b9a57c1b699935","observation_id":"7a1b6fdc-d592-462e-b1e5-baeb59967042","resolution":{"observed_at":"2026-08-06T15:09:52.144547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.121413Z","title":"Segman: Omni-scale context modeling with state space models and local attention for semantic segmen- tation,","venue":null,"work_id":"5789b87f-b8ac-4576-aa4b-ffce7664112b","year":2025},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.922415Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:b831dfad7a9445547f7f2745898d2d7227fdf419760002e754fa30620f97f5ef","observation_id":"c283b729-c639-4132-b377-402c337976f7","resolution":{"observed_at":"2026-08-06T15:09:52.127454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.104402Z","title":"Unified perceptual parsing for scene understanding,","venue":null,"work_id":"831007b8-bbf6-46c9-a2b7-ba53fba0d922","year":2018},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.927031Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:b1b07ad6d9af9249b7eba6e7734ca6b29088128bf50f57f3a075159ad0c0b3b4","observation_id":"6e1883ae-0c0d-4f15-bd0b-554fe884baa4","resolution":{"observed_at":"2026-08-06T15:09:52.110031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.086721Z","title":"Cascade r-cnn: High quality object detection and instance segmentation,","venue":null,"work_id":"6270d05f-b593-4a0d-aa4e-7927fd8b746f","year":2019},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.931190Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:e36472df7ed032cb222c6bf5ddeddba9f40dbfef1cddc7a98780de9f99977867","observation_id":"dd1761c8-0f0a-4f4c-b510-08999a30cd0f","resolution":{"observed_at":"2026-08-06T15:09:52.093189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.069696Z","title":"Moganet: Multi-order gated aggregation network,","venue":null,"work_id":"0670a643-ac3f-40d6-9d1b-fc939baa8db0","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.935462Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:ee0954057e64e67adb5cb787e0c21915c9b9a52769d0cf36c32a7bedf57ae567","observation_id":"00b3a207-6d1d-4489-ba75-28ba9edb9213","resolution":{"observed_at":"2026-08-06T15:09:52.075347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.049307Z","title":"Imagenet classifica- tion with deep convolutional neural networks,","venue":null,"work_id":"6fbeee06-7497-4b8c-9c92-bd4487fe4205","year":2012},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.939788Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:0a8c00be1104cb04d20552526382b39c97b0522aec567f3ff92e63a27dd20fee","observation_id":"7dbe8029-f3a1-47f1-9d31-cf2c491db886","resolution":{"observed_at":"2026-08-06T15:09:52.055737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.031864Z","title":"Very deep convolutional net- works for large-scale image recognition,","venue":null,"work_id":"45752345-3f32-4113-80d8-94f1b5ba8206","year":2015},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.946472Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:f55f62952fa2470370560e078e02303522f2498f414c804afb35e8caf097834b","observation_id":"28ac3b53-c809-4ce7-98dc-a24988dd79de","resolution":{"observed_at":"2026-08-06T15:09:52.037721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.014117Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":"01df34be-2b82-44a9-aa69-4b525cc288b5","year":2016},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.952021Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:5cd0ba04da06b15521ca9a79fe2fb1959eb439e70de326ad9a079b5cb08134c9","observation_id":"5d393ba6-29d0-4826-a9ee-cad7b07bbddd","resolution":{"observed_at":"2026-08-06T15:09:52.019935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.995209Z","title":"Densely connected convolutional networks,","venue":null,"work_id":"3263b486-d4da-475f-b466-51e94f4782f3","year":2017},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.957366Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:306bc0964615c027258ea0579cfc8203e602648027fa83a1920ec8d1035b3d00","observation_id":"7f605f21-1755-4124-ba03-41a201580d8f","resolution":{"observed_at":"2026-08-06T15:09:52.001879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.975909Z","title":"Convnext v2: Co-designing and scaling convnets with masked autoencoders,","venue":null,"work_id":"9d354af6-0457-4655-8c9c-0b732cbeb7b1","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.962465Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:042cd999b4b78ae912a451365e2ed6ad3bf8595acbfdbf645659a097a8bfc3ac","observation_id":"cb93ccad-6b2f-4b64-8608-7220e8cd1d3a","resolution":{"observed_at":"2026-08-06T15:09:51.981255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.957986Z","title":"More convnets in the 2020s: Scaling up kernels beyond 51x51 using sparsity,","venue":null,"work_id":"44032392-554d-4a83-a310-101fec9070b8","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.968379Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:f533be2920712ec8f2d2b25340dab300a21cea52fad4c6fe7e75674e4054d108","observation_id":"643adcb0-7999-4429-8c78-13328e67386c","resolution":{"observed_at":"2026-08-06T15:09:51.964054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.941725Z","title":"Unireplknet: A universal perception large-kernel convnet for audio, video, point cloud, time-series and image recognition,","venue":null,"work_id":"56036182-17a8-4729-bf9c-16e96e2b9bd5","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.973296Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:2d2571d071f32caaca7018d5100dfb1a7c50b5e87cbb43e590a8b76bc63c91f2","observation_id":"12aa3452-af55-4f98-bf1e-a7190b28c1f8","resolution":{"observed_at":"2026-08-06T15:09:51.946801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.925698Z","title":"Pelk: Parameter- efficient large kernel convnets with peripheral convolution,","venue":null,"work_id":"9050b026-795e-4468-9dc6-546ac4f03b1d","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.978499Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:d6eec7cfe164f0e1e75645e8a12db403c07c80d038a6e3aa6e1c123dfbcbec3e","observation_id":"16d376bf-0f05-45a5-94f3-2c84c3228c15","resolution":{"observed_at":"2026-08-06T15:09:51.931226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.909257Z","title":"Hor- net: Efficient high-order spatial interactions with recursive gated convolutions,","venue":null,"work_id":"c2150161-2862-4b3e-ae84-b547bdb986ca","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.983267Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:c78ba9c31368c6d7796ff7dfe248655fa624fba15c77f8bd9202d52f00a3bcd4","observation_id":"a1529784-b230-4f1e-aebe-9ac2981dff83","resolution":{"observed_at":"2026-08-06T15:09:51.914539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:50.987952Z","title":"Focal modulation networks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.987952Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:7447c56dfc6de08f4df58a285dce3cefa915ad2066bbeada430c87d9c07c4b17","observation_id":"ec5c3836-9a92-4a90-84b5-99cad8f21673","resolution":{"observed_at":"2026-08-06T15:09:50.987952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.878046Z","title":"Overlock: An overview-first-look-closely-next convnet with context-mixing dynamic kernels,","venue":null,"work_id":"656d4868-abc0-4b47-bea7-5ee5f5bdef5c","year":2025},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.993755Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:3a64c55a24e8a8fa2cecf806a51a0a464c6cce59570208eefa6740e212b5fa3e","observation_id":"b19a8034-6077-43f6-b0b2-e0034dd3e4d5","resolution":{"observed_at":"2026-08-06T15:09:51.884669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.858802Z","title":"Neural mech- anisms of visual attention: how top-down feedback highlights relevant locations,","venue":null,"work_id":"1a2612a3-116d-45ae-83d0-53697a6a95d4","year":2007},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.998263Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:d1c6c78549a72663ef802b3d3493ee925db483763123c057cb57729fca11e6d1","observation_id":"a9ec3333-e050-4969-9012-0a98f571db77","resolution":{"observed_at":"2026-08-06T15:09:51.865847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.839619Z","title":"Cmt: Convolutional neural networks meet vision transformers,","venue":null,"work_id":"fbf161a8-e8de-422a-89df-348ebb899754","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.003026Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:d1f30df25b8dbb48f1603cbce5b430af21b08522eae98b078454e523eaa44383","observation_id":"5128317b-447b-44c9-9275-87a9cb64838a","resolution":{"observed_at":"2026-08-06T15:09:51.846467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.821833Z","title":"On the integration of self-attention and convolution,","venue":null,"work_id":"70d27365-ca8a-4abd-86de-9b857a7431ae","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.007882Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:250e5ab67f44939b8dbba016dc825540be0842fdf21048699660ec428bf27052","observation_id":"0880391d-1485-4ac4-a046-533ffcf4671f","resolution":{"observed_at":"2026-08-06T15:09:51.827723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.805129Z","title":"Mixformer: Mixing features across windows and dimensions,","venue":null,"work_id":"aacd9a66-81dd-4053-a19f-3f18d920004f","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.012553Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:7ad23d47d9de4053b176bdea840d130f16271748d25f35e1c2386952c08adf01","observation_id":"91fcc3f0-373d-48e3-a882-8720fe7ce769","resolution":{"observed_at":"2026-08-06T15:09:51.810651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.787327Z","title":"Transxnet: Learning both global and local dynamics with a dual dynamic token mixer for visual recognition,","venue":null,"work_id":"3a7f0b57-05d0-4421-8f36-e4aca75b4133","year":2025},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.017183Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:89a72a172dc4b270a97c9798ac5c8adca5f20cc0a5c9f30d226a7e3258aed642","observation_id":"03545270-c0f6-455b-8846-c95e9f04cca2","resolution":{"observed_at":"2026-08-06T15:09:51.792466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.771307Z","title":"Uniformer: Unifying convolution and self-attention for visual recognition,","venue":null,"work_id":"cd744f9b-197e-410a-bd49-0c71eeefa811","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.023961Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:bbf693969dee9db7834cdb88e51f9b67a5dd1da3dd8ff78bc073710b775ab6a8","observation_id":"22569066-d2e4-4aba-8a01-8d3646242ba6","resolution":{"observed_at":"2026-08-06T15:09:51.775741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.754047Z","title":"Scene parsing through ade20k dataset,","venue":null,"work_id":"91cfb2d1-fbe7-4c82-bf1a-385c9ed3f534","year":2017},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.028863Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:c3f98c317107393820307eec410df5c52189d6128dc8066f06024e40bfebf666","observation_id":"6f8883ff-dde9-4f66-a727-bb50269aacca","resolution":{"observed_at":"2026-08-06T15:09:51.759881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.737620Z","title":"The cityscapes dataset for semantic urban scene understanding,","venue":null,"work_id":"87346e73-69d6-44af-bc7e-82d3c988e502","year":2016},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.032953Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:4a900ce0eed6f9bc7febef3fdf8b38c0abf552a0f1d76843459386438e0f8495","observation_id":"f86d9b79-7c75-4220-8ecb-4bec17e5f0e2","resolution":{"observed_at":"2026-08-06T15:09:51.742741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.721252Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":"e4581413-8314-41ea-971b-96587cff126a","year":2014},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.038445Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:00bd799b7168e9905a406f96b12853e75c14cb50b002cce9d8911d91c0a68b6b","observation_id":"8c82a540-b78c-4408-81cb-d6867040d5cb","resolution":{"observed_at":"2026-08-06T15:09:51.726710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.043283Z","title":"Segnext: Rethinking convolutional attention design for semantic segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.043283Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:85a410d95d01a34e7c0278af8b5d22a21199c91b7ac40c7a070ed7c82e8036df","observation_id":"77bbea64-1a7a-4227-b7fc-50e7b8144e1d","resolution":{"observed_at":"2026-08-06T15:09:51.043283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.694650Z","title":"Multi-scale representations by varying window attention for semantic segmentation,","venue":null,"work_id":"7eda3287-72a5-4608-934e-ad1e489cc76c","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.049098Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:33d08d33192f55cf7ccf1be4841eb3b50eb95ec5c9bbc1e0836f6741e4029c8d","observation_id":"d9196c39-f9e7-4554-88cf-07431370702b","resolution":{"observed_at":"2026-08-06T15:09:51.699539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.679436Z","title":"A convnet for the 2020s,","venue":null,"work_id":"98e22fbc-35d0-40a7-a864-31b9e72889c0","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.053901Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:22922812b5a7373e50c3d99bac912c0d14bf9317835dde73d59b29c74cd678a0","observation_id":"15439f9d-68ef-4eae-94d9-f8291e155b51","resolution":{"observed_at":"2026-08-06T15:09:51.684223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.663612Z","title":"Deeplab: Semantic image segmentation with deep convo- lutional nets, atrous convolution, and fully connected crfs,","venue":null,"work_id":"744cf55d-3b03-4efa-9c13-13927ff44688","year":2017},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.058627Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:cb48aff18ad18969b7d9edd01403bb49f28ca6966af798e735757b1a2b61160d","observation_id":"f0e22b52-5ef7-4558-a626-20735c413c99","resolution":{"observed_at":"2026-08-06T15:09:51.668970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.645983Z","title":"Segformer: Simple and efficient design for semantic segmenta- tion with transformers,","venue":null,"work_id":"2b7de920-ebc3-4755-84f6-87ec392dd4a6","year":2021},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.063492Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:b0c95ea52556a94cb84ad59c72a54d1f47f78a38cf0d4a5d8b4e40810e072025","observation_id":"b4c18396-b865-458c-957e-6f0116169af8","resolution":{"observed_at":"2026-08-06T15:09:51.651635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.628953Z","title":"Encoder-decoder with atrous separable convolution for semantic image segmentation,","venue":null,"work_id":"ae7a5bcb-a339-4238-8407-2e4708bdf035","year":2018},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.068752Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:2597882d4e1f3daa64580e34d3e15c4016b36ffef8683abca9bfcecfe67cc53e","observation_id":"8ede2beb-da45-4abe-9517-98d23d432cee","resolution":{"observed_at":"2026-08-06T15:09:51.635160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.612386Z","title":"Quadmamba: Learning quadtree-based selective scan for visual state space model,","venue":null,"work_id":"326b5a4a-fa67-47fa-9e87-2d63e716495d","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.074871Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:ed23e1e8945c9498a3522b57a79cd812611a260a0e22cd4636b69defc06ae453","observation_id":"fd6975bf-1120-470f-b34b-2751e263d2e5","resolution":{"observed_at":"2026-08-06T15:09:51.618075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.595371Z","title":"Inceptionnext: When incep- tion meets convnext,","venue":null,"work_id":"bd344679-718d-44b9-921f-120f0929bab0","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.080509Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:3879327e71621d4ffb16ffdd9344afb50223b1127d1f7a3188c4ccf5c4581742","observation_id":"df65a1c4-3f36-40a0-a9d9-0d426726c940","resolution":{"observed_at":"2026-08-06T15:09:51.600605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.579441Z","title":"Multi-scale vmamba: Hierarchy in hierarchy visual state space model,","venue":null,"work_id":"adcdef46-408e-4601-9449-cc2d62f3d6df","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.086640Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:616e10728a55f67a85b8af577b270a5da961714f6a866adf0bb8399934a5626f","observation_id":"91ffedd3-ea61-412c-a24e-b180ae6ba3d7","resolution":{"observed_at":"2026-08-06T15:09:51.584071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.561661Z","title":"Densenets reloaded: Paradigm shift beyond resnets and vits,","venue":null,"work_id":"22177612-7f79-4558-b26b-9afb50d508ce","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.091457Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:4526fe8d916a592edf4867bb694ce86621fb3297ad668f665a49427e18aa9db1","observation_id":"1a444a73-e66f-4558-9edc-9db3477f0f6c","resolution":{"observed_at":"2026-08-06T15:09:51.568557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.544910Z","title":"Regionvit: Regional-to-local attention for vision transformers,","venue":null,"work_id":"19481f40-9f7e-46e5-ad60-cb826e1d034c","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.096290Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:8592128d85541b0cb1a5b666943f2c08656e858b4b0e617259555bb6fa69b0e4","observation_id":"cff5d136-c713-420b-acfd-8457efa018e9","resolution":{"observed_at":"2026-08-06T15:09:51.550163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.528337Z","title":"Mpvit: Multi-path vision transformer for dense prediction,","venue":null,"work_id":"563a5856-489b-4048-afcf-66a6eb6b9712","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.100808Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:376509d9ec3ff0a6609b78679cf92a1bd69024838745e32fe812db0f986c5cd4","observation_id":"2f4e69f1-b3ae-406d-97c4-aefc8daa60ec","resolution":{"observed_at":"2026-08-06T15:09:51.533753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.512433Z","title":"Conv2former: A simple transformer-style convnet for visual recognition,","venue":null,"work_id":"4afa0fbb-957c-4a89-a6a1-a260ab837dc9","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.105608Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:4090d42aea5a1c5152858559a66af4d11b93bb34490b2cd4586e333ebe25f9f6","observation_id":"a87df564-05ff-4907-9655-48194ac3c1dc","resolution":{"observed_at":"2026-08-06T15:09:51.517351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.496668Z","title":"Scale-aware modula- tion meet transformer,","venue":null,"work_id":"253c3dd0-91c5-469a-b81e-4d050bd80fe4","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.110436Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:857efcd0f3a61b6fee6791064e0ce866ae2fade130254265bca98c46a245b98b","observation_id":"ee731c59-0194-4631-9c26-0dc15ff27d6c","resolution":{"observed_at":"2026-08-06T15:09:51.501947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.481468Z","title":"Internimage: Exploring large-scale vision foun- dation models with deformable convolutions,","venue":null,"work_id":"e7a5703a-65f5-4d7e-ade2-d615aebe6397","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.114692Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:f1abca3c52c7fb6dd0d4f18d1751182b2f967f61d4363ed93325ea4e682b5b75","observation_id":"df2dcf6a-2ae8-4a98-ada7-cad407c44a59","resolution":{"observed_at":"2026-08-06T15:09:51.486061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.464310Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":"6d26877c-20ff-44b2-8493-c81bee8ad44e","year":2009},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.119942Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:1619866f77ccc3e8f58146dbc9eaa75f1476ece0398355f8ddfa95380d64901f","observation_id":"01cdc303-15fb-46fd-8bcd-fa1ffa637835","resolution":{"observed_at":"2026-08-06T15:09:51.469534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T15:09:51.125439Z","title":"Decoupled weight decay regulariza- tion,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.125439Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:43ca17b988c234a08f60a144ba7b79b60577b96355573b60cb332767b803210b","observation_id":"46f210e5-d794-453a-8ebe-babcbc98809e","resolution":{"observed_at":"2026-08-06T15:09:51.125439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.449232Z","title":"Deep networks with stochastic depth,","venue":null,"work_id":"1984ea13-52cc-4930-aa2d-27545d6daf8f","year":2016},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.130573Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:6415c5d7afa2567a9986a966e4a4459b1d668fb7b7ed1c211cd85b3081a8e1da","observation_id":"b7ff434e-4060-49aa-b7ad-82623b732131","resolution":{"observed_at":"2026-08-06T15:09:51.453571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.433095Z","title":"Mask r-cnn,","venue":null,"work_id":"9bf04511-3e05-4366-8727-29d92cea3ec3","year":2017},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.135257Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:2b07c930e9003620fa8c83dac054bea34190ba0f5a8bd4638b02abb9f69c2b98","observation_id":"b5860b4b-f80e-4c06-937c-fcdf935e81c4","resolution":{"observed_at":"2026-08-06T15:09:51.437919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.418677Z","title":"Embedding-free transformer with inference spatial reduction for efficient semantic segmentation,","venue":null,"work_id":"0183096d-82bb-4ecc-ada9-088a921816c1","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.139667Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:adcc15e599bd2deec9cff1a4fb5dca7ed95954a4218820a6045431e3dbf1a511","observation_id":"c2f1edf9-e4f1-44d5-97c8-2e0eebb8890a","resolution":{"observed_at":"2026-08-06T15:09:51.423000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.403480Z","title":"Context-guided spatial feature reconstruction for efficient semantic segmentation,","venue":null,"work_id":"3e5d20d0-fa08-4dbd-b962-697c7e5d977c","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.144490Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:6b6e80914b7e5739b38712695fa21c535e2910fbce68835ecdbd4b40098e0c85","observation_id":"a773eba3-3765-45f9-9fb1-3918a217b3dc","resolution":{"observed_at":"2026-08-06T15:09:51.408059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.385670Z","title":"Vit-comer: Vision transformer with convolutional multi-scale feature interaction for dense predictions,","venue":null,"work_id":"4851a45d-003a-4407-919c-c40b7babb8ee","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.148784Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:df69345a475a491eff71865e4fe5203d85a54deb5451b1bb571eb95c85a67f3d","observation_id":"f50bed9d-a8f6-48ac-aa4d-03d8ff13f6bb","resolution":{"observed_at":"2026-08-06T15:09:51.391151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.368564Z","title":"Object-contextual representations for semantic segmentation,","venue":null,"work_id":"13f11b75-ceec-4757-a37c-72b5ce3eb844","year":2020},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.152775Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:daf4f3eb74bbe02c9c93252dbe90ef2ebc4a61a8fc3ff80ff4993d6b71de0c22","observation_id":"f2f1046e-3227-4edd-971d-a508d6c615a4","resolution":{"observed_at":"2026-08-06T15:09:51.374085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.348923Z","title":"Per-pixel classification is not all you need for semantic segmentation,","venue":null,"work_id":"89bf7f34-aa9b-4e1e-8e74-056a7e59390a","year":2021},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.157382Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:8e1091718912f5f75b95837b5d428cf82733195d30bee4efac20ad2882baef8a","observation_id":"a9f4f958-a50d-4d1d-8478-724084523eb3","resolution":{"observed_at":"2026-08-06T15:09:51.354809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.329690Z","title":"Masked-attention mask transformer for universal image segmen- tation,","venue":null,"work_id":"75161e5e-1612-4348-8e91-866010fa02dc","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.161766Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:feb711646f3509c58868ec48fc4a2b15be85464b991be6dbba3de37696672ee5","observation_id":"b7fce7ff-c498-4fad-8179-26fae062073f","resolution":{"observed_at":"2026-08-06T15:09:51.335264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.308924Z","title":"Feedformer: Revisit- ing transformer decoder for efficient semantic segmentation,","venue":null,"work_id":"401c35d8-e961-4cbb-82d4-63c72bf3a42e","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.166857Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:20a3e4580dfbfc17a157978ced8ae88a8e6d83648d8aa328d4c1c2fec53d2457","observation_id":"9ef877b5-f265-4913-af54-a63d0a1f6db3","resolution":{"observed_at":"2026-08-06T15:09:51.314652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.290648Z","title":"Low-resolution self-attention for semantic segmentation,","venue":null,"work_id":"1117a5a5-c30a-46e3-8902-661613144649","year":2025},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.171430Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:ad2421234f4f5d6607270a5aa2fc4c533740aedee14ae4802f9b5962871f93f1","observation_id":"81f1c021-34b0-4468-925f-b4a2420c8612","resolution":{"observed_at":"2026-08-06T15:09:51.296202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.273719Z","title":"Understanding the effective receptive field in deep convolutional neural networks,","venue":null,"work_id":"27a7f714-99cf-4c37-8dde-c0165a145043","year":2016},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.175719Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:4372065c8aedf13b611784fafe534d1e99bcd8b6e08bfa3db7e57ae75fbc4f3e","observation_id":"adba4fd6-f889-4c54-afb7-0d5615bf66d0","resolution":{"observed_at":"2026-08-06T15:09:51.278942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.253338Z","title":"Deformable convnets v2: More deformable, better results,","venue":null,"work_id":"51270faa-7cf8-4b9a-9b38-f71648dbe2ad","year":2019},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.180396Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:6b7f3f9b77e4b2c0bc6d02b7a8bd96aa2d35f8ee53895b03f56c1a21e355ceda","observation_id":"412d77b3-d95a-4612-b64c-f1e21ae723f6","resolution":{"observed_at":"2026-08-06T15:09:51.261083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T18:42:08.344134Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":74},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 0 inbound Pith citation observations for arXiv:2507.16624."}