{"as_of":"2026-08-10T12:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3c871a586fe6c9f29c28f05fb82b5fc397d33604030c025a3c9dcc97197d3db4","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:19:07.550066Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:41:00.065948Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T22:41:04.546346Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"cited_work":{"arxiv_id":"2507.00698","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.00698","snapshot_observed_at":"2026-08-06T22:41:04.546346Z","title":"Rectifying Magnitude Neglect in Linear Attention","venue":"cs.CV","work_id":"ddedd75c-35b3-47b3-8eb7-dcd630179b32","year":2025},"citing_paper":{"arxiv_id":"2506.21137","last_updated":"2026-05-25T09:25:19Z","snapshot_observed_at":"2026-08-07T09:49:32.507073Z","submitted_at":"2025-06-26T10:47:39Z","title":"Norm$\\times$Direction: Restoring the Missing Query Norm in Vision Linear Attention","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:00.065948Z"},"links":{"cited_paper":"/paper/2507.00698","citing_paper":"/paper/2506.21137"},"observation_digest":"sha256:93382af03d4a92419ac5adf2d8ae0b195fe5a2195f74c6bb35121400812feab6","observation_id":"81d350e6-daa9-4c81-be6a-1967e5c631be","resolution":{"observed_at":"2026-08-06T22:41:04.584489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00698/citation-record","integrity":"/paper/2507.00698/integrity","json":"/paper/2507.00698/citation-record.json","paper":"/paper/2507.00698"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:00.358876Z","title":"Dico: Revitalizing convnets for scalable and efficient diffusion modeling.arXiv preprint arXiv:2505.11196, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:00.358876Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:590649a203ec9ca7d915e2696f7dbf2bfc2be982d0142a96f83bc2fbe0d9e85c","observation_id":"9145a1aa-9c0b-406e-95e8-71c0a101539d","resolution":{"observed_at":"2026-08-06T21:19:00.358876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16157","last_updated":"2026-07-14T12:14:20Z","snapshot_observed_at":"2026-08-08T01:42:20.244756Z","submitted_at":"2025-05-22T02:57:23Z","title":"Fast and Accurate Image Restoration and Generation with Rank Enhanced Linear Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16157","snapshot_observed_at":"2026-08-06T21:19:00.441719Z","title":"Breaking complexity barriers: High-resolution im- age restoration with rank enhanced linear attention.arXiv preprint arXiv:2505.16157, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:00.441719Z"},"links":{"cited_paper":"/paper/2505.16157","citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:67fa30a713e56596d0be7f4550e3849eb1b1c8cc8b5d755516bc1b6669660df3","observation_id":"38d44e7f-7066-4614-825f-8d821ab868e3","resolution":{"observed_at":"2026-08-06T21:19:00.441719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:20.549207Z","title":"Hydra attention: Efficient at- tention with many heads, 2022","venue":null,"work_id":"4ddc3bc0-d3b6-4b1a-9a48-1583bf2fd4ea","year":2022},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:00.540060Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:c196d6c60e5bef8f2701b19ec7015012bd6a994cd44d880ce9e6f7b36adabcf3","observation_id":"9968c608-c7d6-47be-8343-780b5299197c","resolution":{"observed_at":"2026-08-06T21:19:20.687922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:20.291901Z","title":"Efficientvit: Lightweight multi-scale attention for high- resolution dense prediction","venue":null,"work_id":"bc345e89-6112-4cac-a61a-cfd956c849f2","year":null},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:00.645708Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:95246eb6f40d5ee1d0a9186df473b644e32def05064832100b5cf3204510faa2","observation_id":"7ed36598-d3f2-461b-b3b9-20f72eb0b618","resolution":{"observed_at":"2026-08-06T21:19:20.424606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:20.095979Z","title":"Cascade r-cnn: Delving into high quality object detection","venue":null,"work_id":"cb2b45a8-8647-4788-b87e-b852cdebd158","year":2018},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:00.748424Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:5694728c6c48f25783ca6382373e75840cac6723da32308a0b4e00d4341c2311","observation_id":"fa2a4203-d3e1-4574-b86d-9eb975d2443e","resolution":{"observed_at":"2026-08-06T21:19:20.182144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:19.854847Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"2f9b761a-549d-44e7-aa41-e1ece78af7f5","year":2009},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:00.858411Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:171a77bdb3dff8401ee46a49e1ec9085172aa420a661b4602b44adb4336bc649","observation_id":"fa43ff33-8c38-49da-8320-60f96484e4ee","resolution":{"observed_at":"2026-08-06T21:19:19.973630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:19.595713Z","title":"Davit: Dual attention vision transformers","venue":null,"work_id":"8ce84ea3-a2de-4e17-ba5e-2bb3f8578e0d","year":2022},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:01.012236Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:3ef2f810f778ad5e7778edbe2a303f7aed61e1cf0628302e370978ad2638d186","observation_id":"7cf8ae52-dbe5-49db-89af-f966ad21f599","resolution":{"observed_at":"2026-08-06T21:19:19.712271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:19.345193Z","title":"Cswin transformer: A general vision transformer backbone with cross-shaped windows","venue":null,"work_id":"a5425a11-e36f-46f1-956d-3679405a0504","year":2022},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:01.134058Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:47664a3371ae51357e64437a17c6f859be31db630aa136b0e2479b635c835bc0","observation_id":"bb4d78eb-0f84-44bf-80e9-9e44d2df4bf1","resolution":{"observed_at":"2026-08-06T21:19:19.442324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:19.110525Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"7b098dbd-6b5a-4a0b-8968-c86ab5e736e1","year":2021},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:01.251091Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:c3f1a40fa6270631b7f98fcb5af1e5bae8045e738f4ee54d20da1fab7d6ec6cc","observation_id":"65aeffec-e56b-43dd-9f91-dac0e8cc97c0","resolution":{"observed_at":"2026-08-06T21:19:19.212521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17803","last_updated":"2023-06-01T07:42:15Z","snapshot_observed_at":"2026-08-07T09:48:31.741677Z","submitted_at":"2023-03-31T05:25:32Z","title":"Rethinking Local Perception in Lightweight Vision Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17803","snapshot_observed_at":"2026-08-06T21:19:01.373458Z","title":"Re- thinking local perception in lightweight vision transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:01.373458Z"},"links":{"cited_paper":"/paper/2303.17803","citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:10c24ada83a8a473df9901ec309422705d715301dc4914d5abd0607b132b0ec4","observation_id":"e057094e-7088-40dc-a8ea-489f3fa66b1d","resolution":{"observed_at":"2026-08-06T21:19:01.373458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:18.875265Z","title":"Lightweight vision transformer with bidirectional interac- tion","venue":null,"work_id":"88a2feec-f2ba-4886-86c1-4e193f185b7b","year":2023},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:01.483143Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:270adecdcaa8a3b5c97c91a675a909f8e94171f1690d3472d6e4e1fe53fab71f","observation_id":"a22cc143-f269-4b7e-abe9-9212e7770b32","resolution":{"observed_at":"2026-08-06T21:19:18.985748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13337","last_updated":"2025-07-02T03:53:29Z","snapshot_observed_at":"2026-07-06T18:17:42.417326Z","submitted_at":"2024-05-22T04:49:00Z","title":"Semantic Equitable Clustering: A Simple and Effective Strategy for Clustering Vision Tokens","version":3},"cited_work":{"arxiv_id":"2405.13337","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.13337","snapshot_observed_at":"2026-08-06T21:19:07.774280Z","title":"Semantic Equitable Clustering: A Simple and Effective Strategy for Clustering Vision Tokens","venue":"cs.CV","work_id":"5d0779cf-d83f-4106-872b-4b547a96c8a5","year":2024},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:01.613435Z"},"links":{"cited_paper":"/paper/2405.13337","citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:a1f7242041ce49303aae25d489887b3b35c6029062bcb9454edd56f7d240c7d1","observation_id":"2700f76e-44d2-4d84-84d1-7f24dab703be","resolution":{"observed_at":"2026-08-06T21:19:07.865853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:18.620802Z","title":"Rmt: Retentive networks meet vision trans- formers","venue":null,"work_id":"ab4375c0-3623-4122-b05a-4c0217cdbb6a","year":2024},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:01.746008Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:be7433445b61528f44b04348157e5591e4cc50e3e7050a0d8a602615b167090f","observation_id":"dd8ce4a2-e34a-4cd4-a754-99260ff7a66c","resolution":{"observed_at":"2026-08-06T21:19:18.767291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:18.367875Z","title":"Breaking the low- rank dilemma of linear attention","venue":null,"work_id":"e58f274a-8605-4654-9679-aa819ecb8c8a","year":2025},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:01.854249Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:0a725d00d4b19918ceb220298cfd3fab859f355a1a4132bd4b37a521d31e29a2","observation_id":"f4bf5aa4-6466-485a-9aa9-1f84f6110415","resolution":{"observed_at":"2026-08-06T21:19:18.460003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-06T21:19:01.968387Z","title":"Mamba: Linear-time sequence modeling with selective state spaces.arXiv preprint arXiv:2312.00752, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:01.968387Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:baab5065fa1c855b8085a6766910808b680ce2b5311c6c2302eaca882bbdf2b8","observation_id":"9a6c5372-d27b-4e60-8e5e-2d47758cf7c4","resolution":{"observed_at":"2026-08-06T21:19:01.968387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:18.112134Z","title":"Sucheng ren, xingyi yang, songhua liu, xinchao wang","venue":null,"work_id":"fbe8e5e0-3817-4d15-9760-924cffa34812","year":2023},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:02.115568Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:53e622bacc35e4bd76e32ac20d86de8b4e6ab05a9378f7c7f7f6c619bb432a41","observation_id":"d4cda541-698b-4e4f-bf3f-69729724d656","resolution":{"observed_at":"2026-08-06T21:19:18.257598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:17.872014Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":"e67b6ba9-387b-4c86-b61a-aab0bf580d01","year":2020},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:02.283204Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:4edd663aa1f0eab1164e74cf83dbc9d02af33a0abceb30b996a0db4688bafcea","observation_id":"9284c903-2517-4e43-857b-cddf2146f3d1","resolution":{"observed_at":"2026-08-06T21:19:18.000465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:17.640233Z","title":"Cmt: Convolutional neural networks meet vision transformers","venue":null,"work_id":"89bb9911-9a93-4d89-9b66-1a636587110f","year":2022},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:02.417628Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:2f98eb338af905993fe5b0d2eb189a544993834c4f48ace862a7389d66ed2b86","observation_id":"a7893eb1-fb75-4cce-96e9-e653bf927a00","resolution":{"observed_at":"2026-08-06T21:19:17.749859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09741","last_updated":"2022-07-11T04:21:37Z","snapshot_observed_at":"2026-08-04T11:18:15.777540Z","submitted_at":"2022-02-20T06:35:18Z","title":"Visual Attention Network","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09741","snapshot_observed_at":"2026-08-06T21:19:02.542162Z","title":"Visual attention network.arXiv preprint arXiv:2202.09741, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:02.542162Z"},"links":{"cited_paper":"/paper/2202.09741","citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:eb656a9881a4e1b89ca11780b0826a436ea0a376d50e367484568d62ff73abad","observation_id":"67c60d44-9307-4828-ba71-d6c5f7aabbaa","resolution":{"observed_at":"2026-08-06T21:19:02.542162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:17.374321Z","title":"Flatten transformer: Vision transformer using fo- cused linear attention","venue":null,"work_id":"c2dad9e3-c68f-416d-848f-4fc25871dda9","year":2023},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:02.703281Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:bf44f9cc29a4f683f5306a3af054f23aafe9e3cfa2b2983cf6d9610b50c4378c","observation_id":"e7541606-79fa-4579-9eea-6b801c577aaf","resolution":{"observed_at":"2026-08-06T21:19:17.513839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:17.099174Z","title":"Bridging the divide: Reconsidering softmax and linear attention","venue":null,"work_id":"2f25ce2d-9cd2-4cd0-80f9-50ae62cd2b6c","year":2024},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:02.853456Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:6069f6a715e5ff5580808575981498672fd5bdd589e71695e6829d5c1c07263a","observation_id":"007fc3ef-bf38-4d84-bc0a-e954cf921f5a","resolution":{"observed_at":"2026-08-06T21:19:17.243944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:16.851690Z","title":"Demystify mamba in vision: A linear attention perspective","venue":null,"work_id":"240fb9f1-011b-49d7-a7e0-3158e8a19cd3","year":2024},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:02.977280Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:bd2bf243bd86984aa64c5ec67d7452267ab5248054f49674cab7c5a9c7f12230","observation_id":"684443e9-324b-40bb-96d0-a1a5118711bf","resolution":{"observed_at":"2026-08-06T21:19:16.969851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:16.605460Z","title":"Neighborhood attention transformer","venue":null,"work_id":"4f39f923-1f5f-4893-ad7a-70c460edceed","year":2023},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:03.074611Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:1ee34b6d8b2cdd3726f3015863451461585a21146653a27b41bd19435af50c86","observation_id":"c801c2d5-2229-41d7-9389-80e76bcd40eb","resolution":{"observed_at":"2026-08-06T21:19:16.709736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:16.348016Z","title":"Global context vision transformers","venue":null,"work_id":"9698db69-33e4-4b85-bf8d-bb09e0fea305","year":2023},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:03.257442Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:86dedfd283da6c61a33d4cc6b75e599cf1dba95bc5390a3448c168ea032fe15c","observation_id":"6132a6b8-78b6-4d84-98ca-c6e9061e4c3b","resolution":{"observed_at":"2026-08-06T21:19:16.484518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:15.998097Z","title":"Girshick","venue":null,"work_id":"b441256f-9a4c-44eb-85d6-5d7578fc3623","year":2017},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:03.383350Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:01ad74b5c03e2de1a4feb741b09d315f27a2aa34b625f746d3ddfd6b49d87679","observation_id":"a3f96d76-1092-4c26-8099-0373cc51fdfa","resolution":{"observed_at":"2026-08-06T21:19:16.200077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:15.692862Z","title":"Deep networks with stochastic depth","venue":null,"work_id":"d4800da6-8db4-4168-83b4-b70ec7cd3e14","year":2016},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:03.540157Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:a8944a61c7c399e4aa4f30c5af6cdcf9f79193a0ba568b95283f7a1b478fab86","observation_id":"23a6f295-8bd2-49ba-887d-44ee61239b85","resolution":{"observed_at":"2026-08-06T21:19:15.797638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:15.376166Z","title":"Vision transformer with super token sampling","venue":null,"work_id":"0e1d0ca8-d38e-4aad-9763-e2de8651e4d2","year":2023},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:03.669116Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:b27cd3db6a77bd6a11545c38c29795d8605ed51e9053dcbd9229e3507ab3a535","observation_id":"eb157f2a-398b-49dc-80cf-8337b3f47374","resolution":{"observed_at":"2026-08-06T21:19:15.528219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:15.110800Z","title":"Learning correlation structures for vision trans- formers","venue":null,"work_id":"d6341ddd-a3d4-417d-881a-53674218bb61","year":2024},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:03.841594Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:4cb59fda0ee8744e166e69affa58c134fa622b434e9ed3948535c24000b95e57","observation_id":"f67d3941-620f-4400-8136-10affd50f8d2","resolution":{"observed_at":"2026-08-06T21:19:15.251227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:14.878932Z","title":"Panoptic feature pyramid networks","venue":null,"work_id":"1ad8cf95-f421-4ddb-9b6d-e51dca4ea016","year":2019},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:03.964390Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:3e4b3fe3323e8e600ce75b4e1a2f5637c9575c3cc0eeb1140625293228c2c7c5","observation_id":"747b32fa-34d5-4018-93cf-15938b610acc","resolution":{"observed_at":"2026-08-06T21:19:14.978260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:14.650880Z","title":"Mpvit: Multi-path vision transformer for dense pre- diction","venue":null,"work_id":"2a81c8d4-8d98-45dc-94cc-31cbb55d7767","year":2022},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:04.086339Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:04a1db610fe8b8cb1007d9b0b9cab73e0516cabe20b096f2bbe3b46777562af9","observation_id":"b7474ed0-0bfd-4ee7-a734-97d8c6f4eade","resolution":{"observed_at":"2026-08-06T21:19:14.737588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:14.419832Z","title":"Uniformer: Unified transformer for efficient spatiotemporal representation learning, 2022","venue":null,"work_id":"b142b5b7-ee97-4264-b806-e63ea38887b2","year":2022},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:04.241515Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:7192ac5ef7767ba4f42e2902ba9416d571dfd0c0b9346c71a3660cfec09649f8","observation_id":"00c75224-7dcb-4896-a16a-95fd8e7f941d","resolution":{"observed_at":"2026-08-06T21:19:14.554977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:14.150889Z","title":null,"venue":null,"work_id":"af96ba53-24ad-4afb-b57e-dcc29f990742","year":null},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:04.406272Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:1ca192605666d43a4a843e3e553ec30d94cc07e11b8e06804f12f707925143e3","observation_id":"370dcb0a-992f-4ec2-92b6-eb0d032f82c5","resolution":{"observed_at":"2026-08-06T21:19:14.285360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:13.907892Z","title":"Girshick, and Kaim- ing He andPiotr Doll´ar","venue":null,"work_id":"3ee12bdd-7607-4a47-a454-18ec278d1cc8","year":2017},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:04.534424Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:b582ecf271be03b3e5cb3e30347f03216584024b0e2c22db4402e63d33c7f2ac","observation_id":"bc29a7ee-2272-4bed-8938-379b5f8c6017","resolution":{"observed_at":"2026-08-06T21:19:14.013358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:13.650980Z","title":"Scale-aware modulation meet transformer","venue":null,"work_id":"024381cc-d119-47c1-abef-e6ca150e2522","year":null},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:04.632742Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:17649d23887dfbf4349a5e8f932ec5bf1a3b3a20c10a0036641a9ab47e8661f8","observation_id":"961398d4-db02-4e4a-8006-8932dd816ff4","resolution":{"observed_at":"2026-08-06T21:19:13.748595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:13.380814Z","title":"Dynamic group transformer: A general vision transformer backbone with dynamic group attention","venue":null,"work_id":"257b1a57-5fb8-4799-a0e5-184ec9a95700","year":2022},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:04.738314Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:1e4c7d01de9b8cba15667c7e00d2022c2dcbf536f3589937468c30e3581b3853","observation_id":"c5063f46-8e80-49f1-84c8-2c2ea7781c37","resolution":{"observed_at":"2026-08-06T21:19:13.523189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:13.111945Z","title":"Vmamba: Visual state space model","venue":null,"work_id":"8c3ae53d-10d7-4956-a4d1-e3bab6745561","year":2024},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:04.823914Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:58d0802ef338368defa1d2a333caf3202fb71e5d4d88cf1cb88dde33e141186e","observation_id":"c8a1405d-1112-4917-a542-4acc74c8ce00","resolution":{"observed_at":"2026-08-06T21:19:13.213638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:12.895152Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"311f0e29-9202-49b8-8bde-3d5d7da9bd22","year":2021},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:04.944995Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:5e590c4a907b721f2b9bb8c38a54b8a57de7c56f1cd210f139fcda4640e2b767","observation_id":"2ea23477-6179-4bab-8f5f-d7f640d6ceb5","resolution":{"observed_at":"2026-08-06T21:19:12.996651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:12.698961Z","title":"A convnet for the 2020s","venue":null,"work_id":"8c2abde6-9176-48d8-a026-4c6b025af116","year":2022},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:05.086950Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:3ad6e6ad1a5e7d19295c5aa1473638eee90d9bcec843348c12fd1bb8fffbb274","observation_id":"ed0f7482-53f1-4818-be0b-73908df8e59f","resolution":{"observed_at":"2026-08-06T21:19:12.798816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:12.540117Z","title":"Softmax-free linear transformers","venue":null,"work_id":"fdf61668-1e7a-4127-949e-aed54f17d8e0","year":2024},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:05.171699Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:8e35709ff720a339f8e7c72d9a89d17f98f418be64051c5fc5e57701028b2ba8","observation_id":"08c41705-6707-4838-b418-c4e04d07d0f8","resolution":{"observed_at":"2026-08-06T21:19:12.622101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:12.339356Z","title":"Softmax-free linear transformers","venue":null,"work_id":"30a59f03-4fa0-4f23-90e4-5d13efb0739b","year":2024},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:05.318895Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:93b6fe6083ca7338e31c0fc564a20b5e9732bc5f6277aa02c2632a38d36612aa","observation_id":"a8cb825d-52c0-4410-bae2-cf773d7bae30","resolution":{"observed_at":"2026-08-06T21:19:12.436766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:12.162817Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"2793537f-b04b-4a9a-9060-2db8403cad5f","year":2023},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:05.420188Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:0c14e17381c3ca4233fda30d85920ab9d588ac0de1f2e45ab7fbd6fa8301cbdb","observation_id":"5d2f906e-adc3-416b-8c83-a0fe03d8756a","resolution":{"observed_at":"2026-08-06T21:19:12.250065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:11.927499Z","title":"The devil in linear transformer","venue":null,"work_id":"6d6b7560-832b-4d41-ad09-f8bd6f26e7e4","year":2022},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:05.515344Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:17fccd504e0837661710b60e3a4c904890181ea5eaa208bb69999628955ddc52","observation_id":"1ae02984-4b30-45a9-b9e4-356be6fa47d4","resolution":{"observed_at":"2026-08-06T21:19:12.038736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:11.699688Z","title":"Hornet: Efficient high-order spatial interactions with recursive gated convolutions","venue":null,"work_id":"825079dd-4807-4d49-b504-61df1051a44e","year":2022},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:05.650920Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:150da1add62e3a1185734352676617c0a5065fd1b8a2d030432d6739cdfba59a","observation_id":"4ec9b00a-9116-42bb-98f2-0ea248cc993d","resolution":{"observed_at":"2026-08-06T21:19:11.801899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:11.487390Z","title":"Efficient attention: Attention with linear complexities","venue":null,"work_id":"83593003-2ec0-4f96-a812-de94a076989e","year":2021},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:05.745830Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:f5abfd29d75af31fc4b09d77b5efdabe07d54979b4ddbb077b4ce8d07c672db4","observation_id":"4c3cbfe2-bad5-427f-90f9-00740b819da6","resolution":{"observed_at":"2026-08-06T21:19:11.590939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:11.287649Z","title":"Multi-scale vmamba: Hierarchy in hierarchy visual state space model","venue":null,"work_id":"c2a20369-e18a-4619-9857-c84544efed78","year":2024},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:05.895216Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:7f7748b44dacbd52850d5bae687dae7106846b94ee143ac3c7bbaa42e38dd51b","observation_id":"cbafb45d-1ac5-4892-bdb6-17c4287cdb39","resolution":{"observed_at":"2026-08-06T21:19:11.368213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:11.083271Z","title":"Inception transformer","venue":null,"work_id":"683257f3-ce43-4f2a-8f10-b139020fe8a5","year":2022},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:06.045554Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:2d2c2d67f51bc5628fc6e4049a2a0df2f6acee68875e2dc1d8d710fc6dae0632","observation_id":"112ea903-b047-427b-b2fb-b0421cf05a9c","resolution":{"observed_at":"2026-08-06T21:19:11.191507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-06T21:19:06.170766Z","title":"Reten- tive network: A successor to Transformer for large language models.ArXiv, abs/2307.08621, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:06.170766Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:6d562040c23bfc5c0fd739cee8b8e5407d4487b9d1bc4b30f458aea0fff4417c","observation_id":"9e6ed769-669d-4756-9258-e19244369217","resolution":{"observed_at":"2026-08-06T21:19:06.170766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:10.870099Z","title":"Dic: Rethinking conv3x3 de- signs in diffusion models","venue":null,"work_id":"89fa7593-03f6-4a93-823e-5e3a1f2ae1a8","year":2025},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:06.279455Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:4a99e25edfa16ee732dbd8531e89ace3108396dca7f813f8f96ef8164f9453c9","observation_id":"cf793440-fb68-4a7b-add7-e363d0329689","resolution":{"observed_at":"2026-08-06T21:19:10.969507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:10.587441Z","title":"Train- ing data-efficient image transformers & distillation through attention","venue":null,"work_id":"e9be8f41-5e85-44c9-b541-af5bdd52f5b5","year":2021},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:06.380117Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:25779ec249d3ec4788d6a7be49d758c1669f75d60e6e3f1033ccf20346e6608c","observation_id":"aef27405-4883-4441-8f30-0c521621fb38","resolution":{"observed_at":"2026-08-06T21:19:10.746598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:10.309837Z","title":"Atten- tion is all you need","venue":null,"work_id":"d7d64155-c79f-433a-8fa5-e37e71b102ed","year":2017},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:06.510476Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:104c8fd348f64456b857f9f41fdc7e846b0d1857ad1b406ad29bf9aeb1ae0486","observation_id":"10d85d9e-dd51-45e3-bfa6-888fc8281a32","resolution":{"observed_at":"2026-08-06T21:19:10.401613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:10.064955Z","title":"Pyra- mid vision transformer: A versatile backbone for dense pre- diction without convolutions","venue":null,"work_id":"2df35f01-2547-40ca-adc3-d010ba2cc814","year":2021},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:06.619547Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:b5adde89102a25b15de6214e591b627af8ed6ea0fbd11d9a4006b142e9a3308c","observation_id":"91610bd9-c249-4dcb-9593-7a1048f6b2a6","resolution":{"observed_at":"2026-08-06T21:19:10.175152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:09.756355Z","title":"Pvtv2: Improved baselines with pyramid vision transformer","venue":null,"work_id":"70bb71fc-cbe3-4acd-aa19-67afb16b3aaf","year":2022},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:06.762186Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:36c052b46c5398c0f87049b82b3d1f57758ec16d8cda7f22617560268dfb7576","observation_id":"8c2d99c6-723a-4050-bc9f-2ff4e653ef68","resolution":{"observed_at":"2026-08-06T21:19:09.899152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:09.502390Z","title":"Internimage: Exploring large-scale vi- sion foundation models with deformable convolutions","venue":null,"work_id":"8e717cdf-6268-4fae-af1f-9d5ec3e08fde","year":2023},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:06.890045Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:8214603f822e64670de62e87416eb880a56d6fa3b8deeb8f8a2dc9343b26f981","observation_id":"6ea09d62-6872-417b-a30b-c5eb1d3125ba","resolution":{"observed_at":"2026-08-06T21:19:09.620593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:09.241147Z","title":"Unified perceptual parsing for scene understand- ing","venue":null,"work_id":"a6a110b4-4419-43a5-b2b2-0c676b5c6d09","year":2018},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:07.020137Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:f0100c94368ce1a75d7a156a05f2d4ea3334b0f668d753d17f31553d37c00c1a","observation_id":"460d78d2-f125-446f-9093-6e1911ab5586","resolution":{"observed_at":"2026-08-06T21:19:09.375485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:08.994431Z","title":"Gated linear attention transformers with hardware-efficient training","venue":null,"work_id":"18143ed2-5778-426e-818d-5456c446a4b1","year":2024},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:07.155008Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:bf42993f51196a4502a2f0984725e3fdb1e0d1a10596b08d8ad3a5464595affc","observation_id":"237b0ef9-cd20-41be-8031-07c2839921b9","resolution":{"observed_at":"2026-08-06T21:19:09.109098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:08.716830Z","title":"Castling-vit: Compressing self-attention via switching to- wards linear-angular attention during vision transformer in- ference","venue":null,"work_id":"8749f3cb-11ed-4652-8dbb-471626505c50","year":2023},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:07.264319Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:80bd5ddae8fb06535cc9dac6d2cc42ad5222d3abe7f1e996a6c3578c4add4cc3","observation_id":"62bdab7a-f340-401f-9dcf-eb1ed2634f6a","resolution":{"observed_at":"2026-08-06T21:19:08.845820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:08.426691Z","title":"Biformer: Vision transformer with bi-level routing attention","venue":null,"work_id":"3c9272bf-5ae7-4eb4-8052-98850a78ff10","year":2023},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:07.392681Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:6fd89dc622ab00e530c03725c6c11365cdaac5b8b59d76ffa60b60cfcf70b7e5","observation_id":"8ae48306-aa2c-4ec1-bb4a-36ea7db003e3","resolution":{"observed_at":"2026-08-06T21:19:08.577482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:08.156556Z","title":"Dig: Scal- able and efficient diffusion models with gated linear atten- tion","venue":null,"work_id":"1dd19343-e3d1-4188-b206-d6b8b9d72e2a","year":2025},"citing_paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:07.550066Z"},"links":{"citing_paper":"/paper/2507.00698"},"observation_digest":"sha256:18665fea7d86b9555410a3f21e1f6d27e2afcb8be3ac2c97a5a41821482320de","observation_id":"bdc71906-d0ba-4991-be98-0b4c1f94a224","resolution":{"observed_at":"2026-08-06T21:19:08.280714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00698","last_updated":"2025-08-02T02:04:52Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T08:21:43.720002Z","submitted_at":"2025-07-01T11:49:05Z","title":"Rectifying Magnitude Neglect in Linear Attention"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":1,"verified_fuzzy":50},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 1 inbound Pith citation observation for arXiv:2507.00698."}