{"as_of":"2026-08-20T01:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7f0bf8e2782df9a2e0bcf1db963c0d1d8972963972e20954608c1c078b6679db","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:23:09.336104Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T00:50:47.085579Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T00:51:14.493325Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"cited_work":{"arxiv_id":"2505.14719","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14719","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Msvit: Improving spik- ing vision transformer using multi-scale attention fusion","venue":null,"work_id":"5e5555ee-c796-4353-99f0-64200c577f9c","year":2025},"citing_paper":{"arxiv_id":"2605.08270","last_updated":"2026-05-08T03:17:52Z","snapshot_observed_at":"2026-08-11T17:33:59.524661Z","submitted_at":"2026-05-08T03:17:52Z","title":"SAFformer:Improving Spiking Transformer via Active Predictive Filtering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:47.085579Z"},"links":{"cited_paper":"/paper/2505.14719","citing_paper":"/paper/2605.08270"},"observation_digest":"sha256:30113e4502792235d902f3fe7ec7eab2834c1c427846080c8300b6dee0876322","observation_id":"dd57ffb9-535e-4e4b-896b-b118f7a9b997","resolution":{"observed_at":"2026-05-12T00:51:14.495435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14719/citation-record","integrity":"/paper/2505.14719/integrity","json":"/paper/2505.14719/citation-record.json","paper":"/paper/2505.14719"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.833973Z","title":"A low power, fully event- based gesture recognition system","venue":null,"work_id":"17c852f1-66fb-42f9-8e47-f671164d7664","year":2017},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.184221Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:198f2854298707915f21741c120d89ba88964794a0e5fa93d1e7aed7104fb4d5","observation_id":"055a1a60-7c59-4a4e-90ef-f74e1c5747dc","resolution":{"observed_at":"2026-08-15T20:23:09.838136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.192859Z","title":"Is space-time attention all you need for video understanding? InICML, volume 2, page 4,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.192859Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:ddb3ea5e6b7490d167805fa646cf98f645816afd3c609788d36c94b728bad52c","observation_id":"f91eadcf-db24-4bcc-abe8-1fe8d24ddeec","resolution":{"observed_at":"2026-08-15T20:23:09.192859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T20:23:09.213387Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.213387Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:607a2ff52be93bc2453facb9bff3cc7f6737f3c239e222fef0bbe91e78a2ee69","observation_id":"82b31e7f-0f3f-4671-ad32-ec650e83cb13","resolution":{"observed_at":"2026-08-15T20:23:09.213387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.770284Z","title":"Multiscale vision transformers","venue":null,"work_id":"d18b4fcd-c6c3-499d-8ea5-e1e3abcc6c54","year":2021},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.217713Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:b5816c811bcb9d8c3ae5e60237e8f1bc5bba04c46c6fcaf13df2ee2f86a84e0c","observation_id":"2a06fc71-c453-4ede-9ed4-03907a59d312","resolution":{"observed_at":"2026-08-15T20:23:09.774166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.756771Z","title":"Levit: a vision trans- former in convnet’s clothing for faster inference","venue":null,"work_id":"786ef45d-5453-4c8b-97ad-4b5648022cd5","year":2021},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.221601Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:59296604a1af4c132773eb5a063884fe20fff5b4fa1ef59d7424f01bbf117ca3","observation_id":"6e42b34a-d4f6-469e-98c4-11a415b82091","resolution":{"observed_at":"2026-08-15T20:23:09.761000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.744532Z","title":"Multi-scale self- attention for text classification","venue":null,"work_id":"de3e2605-7eb5-4b8b-86be-15837965d613","year":2020},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.225294Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:e4eb35164c6c799ebeea45a93d38c7b40ac53b52872b7349692277ac5aca3644","observation_id":"eb467d04-bda1-422e-9f23-9133eea834d1","resolution":{"observed_at":"2026-08-15T20:23:09.748948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.731420Z","title":"Pct: Point cloud transformer.Computational Visual Me- dia, 7:187–199,","venue":null,"work_id":"e45232da-e954-4dda-9351-700b1da2318e","year":2021},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.228577Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:0062cf6ddfb6c4ffd9f2ac2f380ba96b81d8f49269be6d6957829384a607aab2","observation_id":"47be100a-24ed-4acc-8d7c-9a50c4337170","resolution":{"observed_at":"2026-08-15T20:23:09.736387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.231770Z","title":"Masked au- toencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.231770Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:45ea8ca3b91f6e3f842c349915565bc2756d0d80deacc7eddd8badf696086c9a","observation_id":"a653f433-0b03-404e-a187-ac83872a7c6d","resolution":{"observed_at":"2026-08-15T20:23:09.231770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.654023Z","title":"Cifar10-dvs: an event-stream dataset for object classification.Frontiers in neuroscience, 11:309,","venue":null,"work_id":"087a1c77-57bf-4585-a058-c6aeeced9249","year":2017},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.251031Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:bba8234b49664f8a13eb45f29fdaeb80dff38f5f572704c19b417ac5fed8cf20","observation_id":"24a82edf-4152-4fbb-883f-242e0d29371f","resolution":{"observed_at":"2026-08-15T20:23:09.659181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.641632Z","title":"Rethinking vision transformers for mo- bilenet size and speed","venue":null,"work_id":"6469f0af-7a55-464e-8c6b-96b3a6f908ee","year":2023},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.254693Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:38278cfbae1919d69f89aafc55ea7a309c0c3c20f622371c79c4e50ec33cddda","observation_id":"5eb0a6fd-c583-4a95-8ba9-13553a41f727","resolution":{"observed_at":"2026-08-15T20:23:09.646250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.258689Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.258689Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:1d1552d18bde7cd14de7a5e4b96f0688559fde8b445f8389032a85c56a8f376a","observation_id":"e06f31f0-d303-4590-8bac-9be4499409d0","resolution":{"observed_at":"2026-08-15T20:23:09.258689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.622034Z","title":"Ecoformer: Energy-saving atten- tion with linear complexity.Advances in Neural Informa- tion Processing Systems, 35:10295–10308,","venue":null,"work_id":"ab8e6d50-767f-4070-a7d2-c5fcec905394","year":2022},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.262711Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:c95a13746b25b1d1fe63b043395ffb643faa28229dd347aaefd0095a230bfc27","observation_id":"760b0a38-0b72-495a-8a29-0732577518a6","resolution":{"observed_at":"2026-08-15T20:23:09.625832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.266700Z","title":"Networks of spiking neu- rons: the third generation of neural network models.Neu- ral networks, 10(9):1659–1671,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.266700Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:5ddf3d9f8a285c183a0ca0277c23ac9009d37e1e781ca264a6a79eb2952bb2ee","observation_id":"317dd609-931e-4718-9b71-c064430a2a86","resolution":{"observed_at":"2026-08-15T20:23:09.266700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.600217Z","title":"Image super-resolution with non-local sparse attention","venue":null,"work_id":"642e56f3-6084-439e-83f0-b1c9b656eeab","year":2021},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.274616Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:96327f82f6b050efe2a6ba7cb72e313576bba8a3dd7f5bea2439cfc034ef9030","observation_id":"ff0a2e9c-ce3a-404f-9965-67e96b685a11","resolution":{"observed_at":"2026-08-15T20:23:09.604396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.585750Z","title":"Transformers for image recognition at scale.On- line: https://ai","venue":null,"work_id":"b5bb7f8e-f3be-4b3e-bfae-c48cd0fa6165","year":2020},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.278573Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:80d7f0fad48661e4666c561ee31f91668ed56bba7096a8499af23f1af49a8ac3","observation_id":"717e5e5f-f7ce-4837-afd1-a153e6138b25","resolution":{"observed_at":"2026-08-15T20:23:09.591633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.572144Z","title":"X-linear attention networks for image captioning","venue":null,"work_id":"62c0ef43-eb75-47c1-87aa-d7d79f857385","year":2020},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.282565Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:c08540fae500f4ff35565f0fda42dd07b34fb7f4eafc1ece2d69f756bd60d98d","observation_id":"9d1af8ec-b18a-454a-ad19-da57e4d1c125","resolution":{"observed_at":"2026-08-15T20:23:09.576445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08779","last_updated":"2019-12-03T18:19:07Z","snapshot_observed_at":"2026-08-15T18:44:59.455586Z","submitted_at":"2019-04-18T17:53:38Z","title":"SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08779","snapshot_observed_at":"2026-08-15T20:23:09.286245Z","title":"Specaugment: A simple data augmentation method for automatic speech recognition.arXiv preprint arXiv:1904.08779,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.286245Z"},"links":{"cited_paper":"/paper/1904.08779","citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:f88ced994476460657c68cdeb100d5dd868e6cf4c67988d697d69c5b415d8594","observation_id":"a16d5591-2f9b-4db3-95cc-40a8f436e322","resolution":{"observed_at":"2026-08-15T20:23:09.286245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.546198Z","title":"Towards spike-based machine intelligence with neuromorphic computing.Nature, 575(7784):607–617,","venue":null,"work_id":"f27b17d9-313d-481a-9d7f-1f2d9bb6ad83","year":2019},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.294198Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:88057b793592a6edfa58ee3590accfb3cd697e6620992bca60ba49d7d7b821a3","observation_id":"22efe85b-d1ad-4f78-8444-12bad81a2582","resolution":{"observed_at":"2026-08-15T20:23:09.550838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.533080Z","title":"Spikingresformer: Bridging resnet and vision trans- former in spiking neural networks","venue":null,"work_id":"112bea72-3358-452f-bec6-f126ab582cf7","year":2024},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.297954Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:d40152e7e47ace8b4b0ffc32ae9f754a719aeae777c1ab3b34779d64c571abd7","observation_id":"2a5be4e0-bbc9-4cd3-ab49-9eda05a98eb8","resolution":{"observed_at":"2026-08-15T20:23:09.537634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.305395Z","title":"Attention is all you need.Advances in neural information processing systems, 30,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.305395Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:147bab8574340115d0f595dc14548f0294b1f28b970566aa0d16a84b433980cd","observation_id":"e7068879-3fe9-414d-8d2f-fd4a98ca8fe8","resolution":{"observed_at":"2026-08-15T20:23:09.305395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.495051Z","title":"Pyramid vision transformer: A ver- satile backbone for dense prediction without convolutions","venue":null,"work_id":"6e21ee27-55af-4c97-93a7-6f664ff45d48","year":2021},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.309125Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:6a74a269c7cadd433e84301885427afab1582b666e4c1c9d644e8403ece10b11","observation_id":"5ed70b70-dd3e-457f-a313-832a90aacfbd","resolution":{"observed_at":"2026-08-15T20:23:09.499317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.481654Z","title":"Generalisation of structural knowledge in the hippocampal-entorhinal system.Advances in neural information processing systems, 31,","venue":null,"work_id":"d38ac1d5-1cae-4174-b3cd-a7af3ef90e8c","year":2018},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.312927Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:21b15bf4c7ec142a6e0fbc52fc997bd781b93609c0158a26689d560519e05ba0","observation_id":"28590d8a-6cf0-4be8-ad6a-afcd6459e260","resolution":{"observed_at":"2026-08-15T20:23:09.486265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13929","last_updated":"2022-09-28T09:00:45Z","snapshot_observed_at":"2026-08-16T16:29:18.645789Z","submitted_at":"2022-09-28T09:00:45Z","title":"Attention Spiking Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13929","snapshot_observed_at":"2026-08-15T20:23:09.316585Z","title":"Attention spiking neural networks.arXiv preprint arXiv:2209.13929,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.316585Z"},"links":{"cited_paper":"/paper/2209.13929","citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:95d32c0d9d5e28c7961099647dc484f469c2f1edc48a4b430f0899c802468988","observation_id":"1888c2df-9c17-44b5-a80b-ba4407615277","resolution":{"observed_at":"2026-08-15T20:23:09.316585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.320558Z","title":"Metaformer is actually what you need for vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.320558Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:aea8f8394bfecac5fc31ba2d796b6567239304b8ed892c436b24676c39d9d867","observation_id":"7175f1aa-8d59-43ef-b8d6-b103f3698797","resolution":{"observed_at":"2026-08-15T20:23:09.320558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.462207Z","title":"Spiking transformers for event-based single object track- ing","venue":null,"work_id":"e146c61b-c189-43d3-878b-788b836d9679","year":2022},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.325084Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:356cc08ae9d8a2bd7ef0ab8cc14a7afa0b4fb42bb3937ff64124e2f74df02532","observation_id":"d9dbcf24-ca8a-4e78-b181-235970edee3a","resolution":{"observed_at":"2026-08-15T20:23:09.465859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.450111Z","title":"Random erasing data aug- mentation","venue":null,"work_id":"54aacd65-f7d5-4bc2-8805-0902bd31c761","year":2020},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.328813Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:261805ef71df5401305c3c5996fad65f89017f9447d053db5898480fb48f7cb1","observation_id":"41fa3197-88e7-4dc5-9a04-3c05f38ea3cf","resolution":{"observed_at":"2026-08-15T20:23:09.453576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.438514Z","title":"Spikformer: When spiking neural network meets transformer","venue":null,"work_id":"ad1af0ee-98a2-4b77-868f-774f34739f1b","year":2023},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.332493Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:aab7bf5f0bedbcc46b7789510923d0217a1954f33fcf6e39bdc6a6b1a3459e67","observation_id":"d66c3ca4-6f24-41db-a28d-7fc24354b1a1","resolution":{"observed_at":"2026-08-15T20:23:09.442312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.421773Z","title":"Spikformer v2: Join the high accuracy club on imagenet with an snn ticket.CoRR, 2024","venue":null,"work_id":"550064b5-6f95-4f70-a656-30a069fe31bb","year":2024},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.336104Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:aa8ffd24c4f0c9cb4099f724181ed2b2671fa1ae2b681fb28dcb5a4d5e93ea6f","observation_id":"df0b0859-678a-4997-986e-6cd4bf779652","resolution":{"observed_at":"2026-08-15T20:23:09.429115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.247835Z","title":"Learning multiple layers of features from tiny im- ages","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":1984,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.247835Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:ae3213bace6cc876bb86f7ba0ddc349ffb6fa43feb3f7546a035f5509fc69ee7","observation_id":"7646cdf5-e061-4259-a0b8-adde97523d99","resolution":{"observed_at":"2026-08-15T20:23:09.247835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02178","last_updated":"2022-03-04T17:17:31Z","snapshot_observed_at":"2026-08-17T03:16:02.000706Z","submitted_at":"2021-10-05T17:07:53Z","title":"MobileViT: Light-weight, General-purpose, and Mobile-friendly Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02178","snapshot_observed_at":"2026-08-15T20:23:09.270653Z","title":"Mobilevit: light-weight, general-purpose, and mobile-friendly vision transformer.arXiv preprint arXiv:2110.02178,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":1997,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.270653Z"},"links":{"cited_paper":"/paper/2110.02178","citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:4a0e4a69dcff43e58701f0af71027b22d0f98232078d41563d9220c5e62f672a","observation_id":"dfc1d53a-80b4-457b-ac64-632926869353","resolution":{"observed_at":"2026-08-15T20:23:09.270653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-15T20:23:09.209654Z","title":"Bert: Pre-training of deep bidi- rectional transformers for language understanding.arXiv preprint arXiv:1810.04805,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.209654Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:778502dd9a988232cd1507d6762fa2989d1c941ee11c6e58782a9f8db03bb802","observation_id":"d313e065-4041-4693-844e-08402961867d","resolution":{"observed_at":"2026-08-15T20:23:09.209654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.702002Z","title":"Deep networks with stochastic depth","venue":null,"work_id":"ec377a39-8ed0-4517-a482-d29622632d48","year":2016},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.238461Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:aa527b15d64e2e2c7065484f14f46e48a9472c510e61197b38e7d969691cf0e5","observation_id":"b733114b-7a15-4f06-a77f-7521396058c0","resolution":{"observed_at":"2026-08-15T20:23:09.706322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.689003Z","title":"Fact: Factor-tuning for lightweight adaptation on vision trans- former","venue":null,"work_id":"6e75c6ce-de28-4be3-83d9-56f6220a60cf","year":2023},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.241573Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:67654d5e05c7e767e8b9e933775ffa2f1f8cfcb6f21aa3dd6e24b0822d93e297","observation_id":"b160c551-de3c-4832-b145-f31ad2089c3c","resolution":{"observed_at":"2026-08-15T20:23:09.693739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.820867Z","title":"Segnet: A deep convolu- tional encoder-decoder architecture for image segmenta- tion.IEEE transactions on pattern analysis and machine intelligence, 39(12):2481–2495,","venue":null,"work_id":"2a17ef5a-0c1a-474d-bf99-112769b74bd5","year":2017},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.188671Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:4beaba5e87a7f1162955a96724cf87bd2fc68bb99d59d500e8ef8485160a32ec","observation_id":"40ed87a2-7c6e-402e-83ce-3e73aa0f7587","resolution":{"observed_at":"2026-08-15T20:23:09.825552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.789256Z","title":"Randaugment: Practical auto- mated data augmentation with a reduced search space","venue":null,"work_id":"80071cc3-4c30-4ee1-b171-4a42bbb8f719","year":2020},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.201131Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:7460513fb1c230c007d447b1656f0550bd10102169d5160b93794c9adfad1686","observation_id":"3c64f53f-79e4-4858-bac1-daf678ec69a6","resolution":{"observed_at":"2026-08-15T20:23:09.793471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.559129Z","title":"Towards artificial general intelligence with hybrid tianjic chip architecture.Nature, 572(7767):106–111,","venue":null,"work_id":"367056bb-11b0-4952-9e67-8cd1aa57bf20","year":2019},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.290250Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:5aa5672fb5f8eeca2e5b5180de9202c32e6064ebfce04b97f7461730e472b192","observation_id":"3712a900-6904-42fb-b566-0038984193fa","resolution":{"observed_at":"2026-08-15T20:23:09.563412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.205508Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.205508Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:f778d2d604811f32be610b8b97abb2904247addfe0a33da081a8014e8dc4c6a7","observation_id":"031bcd45-df6b-42e2-b133-ac6d541fb24e","resolution":{"observed_at":"2026-08-15T20:23:09.205508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.801617Z","title":"Encoder-decoder with atrous separable convolution for se- mantic image segmentation","venue":null,"work_id":"ceb10956-1c6e-4d41-aec4-4d0142d4c1ee","year":2018},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.196960Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:b56c779025d9b40f617d02d79ed1bb007ce9c983995fb8b7d628d0799c578496","observation_id":"33591354-bc7f-4203-a1da-f695a847f20d","resolution":{"observed_at":"2026-08-15T20:23:09.805635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.235181Z","title":"1.1 computing’s energy problem (and what we can do about it)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.235181Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:f90fe646f6362f31f948602049923084057ae8f587cd2631559e20e135c0ad4c","observation_id":"8600743d-36a3-4327-bff3-92b08c881f78","resolution":{"observed_at":"2026-08-15T20:23:09.235181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.676317Z","title":"The structure of im- ages.Biological cybernetics, 50(5):363–370,","venue":null,"work_id":"4af9f25f-b415-4290-b4b9-2f3032cb18b0","year":1984},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.244584Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:caef21343c91585a0a95a5852a7372e9f40b4d5e09347a9db8e10ba165d64f8d","observation_id":"ce156112-a99c-4fda-83a4-a70072a16501","resolution":{"observed_at":"2026-08-15T20:23:09.681102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:23:09.518803Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"d56243b5-3024-489f-8916-d29cdf2ce0e1","year":2021},"citing_paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:09.301684Z"},"links":{"citing_paper":"/paper/2505.14719"},"observation_digest":"sha256:56e2d95948aef470eeba8b81cba5845aff0a1feb7792cd049aecc9ddf5cca08a","observation_id":"01548185-13d6-4997-a3ae-1f1ff1bc915a","resolution":{"observed_at":"2026-08-15T20:23:09.523036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.14719","last_updated":"2025-06-18T03:58:23Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T11:30:09.424001Z","submitted_at":"2025-05-19T14:01:03Z","title":"MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2505.14719."}