{"as_of":"2026-08-11T11:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bac91eb89637a1e8acc069fefb5fcf1bcde75576b1f31db4f3181909c2becf14","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:10:56.814914Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.06040/citation-record","integrity":"/paper/2501.06040/integrity","json":"/paper/2501.06040/citation-record.json","paper":"/paper/2501.06040"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T21:10:56.658354Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.658354Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:3d13d7fe45f55af0a7fc845d9d7a7b4b41f85a5a4c9e0b3df0cca909e713fd9b","observation_id":"8c11f804-e77e-4900-85e5-3db976a22ced","resolution":{"observed_at":"2026-08-10T21:10:56.658354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:56.663404Z","title":"Do vision transformers see like convolutional neural networks? Advances in neural information processing systems, 34:12116–12128, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.663404Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:2b3ffbc0829f9d8538337ad0b18d486402656caaff93d20dafc096159a1e266d","observation_id":"c249db0d-64f7-4994-982f-c3ef8b4b50c6","resolution":{"observed_at":"2026-08-10T21:10:56.663404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:56.668402Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.668402Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:de29f364717e107bbad6c7fdda22b8fe07c2c95ecb23959a94e7e9385ba06226","observation_id":"1a030ed8-fb77-4365-bd5f-77f2f8524633","resolution":{"observed_at":"2026-08-10T21:10:56.668402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:57.347072Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":"5ac10f80-5264-4a3b-9ed1-a843910e3e08","year":2008},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.673143Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:b0045ad7b42fed0c240f596d9d536ecf9539f1757877f8abe1a7680af7ed6bb2","observation_id":"0989783b-fdb4-466a-b3c4-b1425ea310e0","resolution":{"observed_at":"2026-08-10T21:10:57.352092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:57.332181Z","title":"Hard sample aware noise robust learning for histopathology image classification","venue":null,"work_id":"8c32f512-5942-421b-93dc-d43b34ba5ba9","year":2021},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.677622Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:9baa133e02e2f3c2541f8089a714ffdfd8eba8b1ffbd9040bda2c4ac0b523918","observation_id":"ba492bf7-320a-495c-8874-bf59fbf4d05a","resolution":{"observed_at":"2026-08-10T21:10:57.336834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:56.682157Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.682157Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:5b8471cbbc85ed2e65072c8d6533d9ce63f64667d39f17b9295446896a8b819c","observation_id":"6a4f394e-9a95-489e-959e-a941497b2a40","resolution":{"observed_at":"2026-08-10T21:10:56.682157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:57.304115Z","title":"Tokens-to- token vit: Training vision transformers from scratch on imagenet","venue":null,"work_id":"b4bae70d-b35f-46ac-9096-96c42fc2da4e","year":2021},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.686586Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:9b5af6d7f28b0c4265c26a150aebc400899c76050ac3e3beea53a81eadb6147a","observation_id":"66c6a6c0-3a42-409f-98d1-149c591bef96","resolution":{"observed_at":"2026-08-10T21:10:57.312732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-07-06T10:02:45.105181Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-10T21:10:56.690827Z","title":"Deformabledetr:Deformabletransformersforend-to-endobject detection","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.690827Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:54b7393efaaa8b34f6ffde6275c425e1e56d4e11ba8239c05afbc5a1699659a4","observation_id":"0615328b-59ff-435c-98c8-dbe500c0b03b","resolution":{"observed_at":"2026-08-10T21:10:56.690827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:57.278300Z","title":"End-to-end object detec- tion with transformers","venue":null,"work_id":"98c49453-abf6-44a0-9f14-eb0bd40e5b50","year":2020},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.696279Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:972593418e94d3539f8cb45396d743ec369c728ad6c849e0ff09d46e64016592","observation_id":"014d6812-212b-4eae-bf5a-8a0e8aabd253","resolution":{"observed_at":"2026-08-10T21:10:57.284851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:57.260617Z","title":"Crossvit: Cross-attention multi-scale vision transformer for image classifica- tion","venue":null,"work_id":"097bdef9-74d7-47fd-9d0a-57e2482be053","year":2021},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.701036Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:7787dc62686646a4f23525c3af5808dee698ff6738482883b152487b4c09dcbe","observation_id":"979151fb-790c-4c13-b947-09d214cb245f","resolution":{"observed_at":"2026-08-10T21:10:57.267071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.05707","last_updated":"2025-02-12T13:35:59Z","snapshot_observed_at":"2026-08-09T23:57:42.753825Z","submitted_at":"2021-04-12T17:59:22Z","title":"LocalViT: Analyzing Locality in Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.05707","snapshot_observed_at":"2026-08-10T21:10:56.705610Z","title":"Localvit: Bringing locality to vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.705610Z"},"links":{"cited_paper":"/paper/2104.05707","citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:25bf907f0449fd162e77d29f1204c60c565fb46791399602bc7c951a7db65436","observation_id":"64052717-370a-4a2c-a887-6635dfafb27c","resolution":{"observed_at":"2026-08-10T21:10:56.705610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:56.710922Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without con- volutions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.710922Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:2abf02b7139d820d4d619f4f1f86166f9b45aa7f9073005fe10d1dcd9a92880d","observation_id":"1d8a600e-0de6-40fb-b4ce-cc8d1ebf3d04","resolution":{"observed_at":"2026-08-10T21:10:56.710922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:57.237385Z","title":"Swintransformer:Hierarchicalvision transformerusingshiftedwindows","venue":null,"work_id":"24239671-6c50-4f31-9a3a-dc975909e4f8","year":2021},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.715672Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:41a707e33d316c9170d7d6e6cd3a56e2e250c16e8bde96b249e7092bd5d8661c","observation_id":"22e13222-09ec-4b4b-91f0-f9eefdfd7c5c","resolution":{"observed_at":"2026-08-10T21:10:57.242255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:57.219918Z","title":"Biformer: Vision transformer with bi-level routing attention","venue":null,"work_id":"ec9ec313-38b4-4ac8-9a8e-fbd1e5abde70","year":2023},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.720617Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:e435dab6197d63fc11ace52d091dfd748bb843f9c087a967372da100c6d50b3e","observation_id":"0cb0b562-7157-4482-93a1-9e2d3a2d9dc8","resolution":{"observed_at":"2026-08-10T21:10:57.225559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:57.202510Z","title":"Cvt: Introducing convolutions to vision transformers","venue":null,"work_id":"2fc80ab5-ac2f-4359-9e0f-b0b8cd98662e","year":2021},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.725553Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:5d255c5decc3e8ae614510da7f74600ef912182eeca8f64cbce064ea6af1c4c5","observation_id":"ee55257f-9bb2-42c0-9ae8-2c1fab0236eb","resolution":{"observed_at":"2026-08-10T21:10:57.207772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:56.729463Z","title":"Twins: Revisiting the design of spatial attention in vision transformers.Advances in neural information processing systems, 34:9355–9366, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.729463Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:d11dac1ce3555352d90641d623d5225e31d36c6d4f413e29f043a0f49479de47","observation_id":"9ac613ab-aaaf-4852-989a-5dfa66558e32","resolution":{"observed_at":"2026-08-10T21:10:56.729463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:57.179214Z","title":"Maxvit: Multi-axis vision transformer","venue":null,"work_id":"f30ee1b9-bc16-4f23-87d4-b10c7db7d3ad","year":null},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.734094Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:3a90cd7d65cbd8e8c708615eaa55d466ab279c9594dceb4e6626a98ab19545a1","observation_id":"28c6b03f-9c37-44ce-8aff-9763058e0644","resolution":{"observed_at":"2026-08-10T21:10:57.184542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:56.738970Z","title":"Coatnet: Marrying convolution and attention for all data sizes.Advances in neural information processing systems, 34:3965–3977, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.738970Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:7de4888fd794ebb700b4e7f3b7558449bf0cb43ef231e906bc4028d78fe6f2a4","observation_id":"c45ecc1b-8f40-4cc9-aec9-734c7de71c57","resolution":{"observed_at":"2026-08-10T21:10:56.738970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.05704","last_updated":"2022-06-07T19:25:30Z","snapshot_observed_at":"2026-08-11T00:43:45.730531Z","submitted_at":"2021-04-12T17:58:56Z","title":"Escaping the Big Data Paradigm with Compact Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.05704","snapshot_observed_at":"2026-08-10T21:10:56.743958Z","title":"Escaping the big data paradigm with compact transformers.arXiv preprint arXiv:2104.05704, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.743958Z"},"links":{"cited_paper":"/paper/2104.05704","citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:798550cf5fe8bab205c0fe150a7ba769d0a8f1496b0cba69988de9284f72be0e","observation_id":"88d109fd-86be-4f1a-9001-ae5460cf437d","resolution":{"observed_at":"2026-08-10T21:10:56.743958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:57.148987Z","title":"Conformer: Local features coupling global representations for visual recognition","venue":null,"work_id":"3eb808f6-d1af-4073-a189-ffaba0b9f93d","year":2021},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.748504Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:7d8c2fcf2b1ae13e6306522bf308e9822711495eca6e5682a0fe41dcc59f583d","observation_id":"3f91ffda-3681-4909-95ce-64f6fe81481f","resolution":{"observed_at":"2026-08-10T21:10:57.153895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:57.132693Z","title":"Efficient training of visual transformers with small datasets","venue":null,"work_id":"db1a9337-b264-4f19-b5a7-2b20c680410d","year":2021},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.755720Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:13874b561a869803360753a5afd44ca77347fd8f0747ebfa641888429767d435","observation_id":"b7f4396b-c271-477c-b181-fee62748ba43","resolution":{"observed_at":"2026-08-10T21:10:57.138937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13492","last_updated":"2021-12-27T03:24:03Z","snapshot_observed_at":"2026-08-10T01:24:59.733860Z","submitted_at":"2021-12-27T03:24:03Z","title":"Vision Transformer for Small-Size Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.13492","snapshot_observed_at":"2026-08-10T21:10:56.759941Z","title":"Vision transformerforsmall-sizedatasets","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.759941Z"},"links":{"cited_paper":"/paper/2112.13492","citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:dc4e5a2de56f1e9bb56c1f71a3e290dfdf4cd15fd1e983cddf1d34bb425b2b17","observation_id":"0147dc57-d28a-4b1c-b80d-fc5d42ce7790","resolution":{"observed_at":"2026-08-10T21:10:56.759941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:57.117470Z","title":"Transmcgc: a recast vision transformer for small-scale image classification tasks","venue":null,"work_id":"673a4351-07f7-4c65-81a9-e85b1b03f666","year":2023},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.764554Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:08be26e29588423e916b1eed6dcac9d271e7ce5ba4b9cda327536e285173803b","observation_id":"70b7a00f-e487-43de-8895-0258eaeafacf","resolution":{"observed_at":"2026-08-10T21:10:57.122165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:57.101671Z","title":"Accumulated trivial attention matters in vision transformers on small datasets","venue":null,"work_id":"563b9333-f9cb-4e41-a53b-7581401d9595","year":2023},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.768244Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:8c1c3025d200be24b5885990bc3a19bfb6a925adfd6dbd5640d0a2478170aaf6","observation_id":"a2c874a7-08d1-47be-8806-2a20424d649a","resolution":{"observed_at":"2026-08-10T21:10:57.107133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:57.085497Z","title":"Early convolutions help transformers see bet- ter","venue":null,"work_id":"3e678db7-d8af-493e-b899-8e526e262014","year":2021},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.773003Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:eae10283237e907612b432c59a4a3078a5c52b010efb11759274fee562bc3018","observation_id":"559f69fd-aeee-4240-a36b-8f008629f046","resolution":{"observed_at":"2026-08-10T21:10:57.092113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:57.068563Z","title":"Efficientvit: Memory efficient vision transformer withcascadedgroupattention","venue":null,"work_id":"798bbc82-a401-4de6-97ac-10811d644d31","year":2023},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.777154Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:659facb2e584d4d1ff62cabab07e44d1c20cccc97afc11a8031eefa16b196f06","observation_id":"f5d08a49-8edd-409a-9f19-f3bb16fcda99","resolution":{"observed_at":"2026-08-10T21:10:57.073910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:56.782472Z","title":"Pvt v2: Improved baselines with pyramid vision transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.782472Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:b1acf2afc88016ddfbffaafac61c5cc11d8f1eb02121c6e89b218527ed6634ca","observation_id":"a1cd2f4b-959a-47fc-97d7-a0cd2d9f3eb5","resolution":{"observed_at":"2026-08-10T21:10:56.782472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:57.036593Z","title":"Moganet: Multi-order gated aggregation network","venue":null,"work_id":"df2cd645-f0c8-4bac-bd78-9974b7561b6c","year":2023},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.787282Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:2b4bed32803fc1b27e93d14981374bbbeae80b675cb2c5a6617ce997f7418b1b","observation_id":"40aaaa92-adee-4332-b527-a47d2ed778d0","resolution":{"observed_at":"2026-08-10T21:10:57.043346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:57.019636Z","title":"Visual attention network","venue":null,"work_id":"d64bfbdd-e15e-45b8-a395-fe6fe3be8a8f","year":2023},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.791900Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:8071868d4f7c304e627ac385c0c179055a00d07bb3920b90a8a6abcd6ff658b7","observation_id":"b22fc425-e839-41c5-86b8-c1a9901929aa","resolution":{"observed_at":"2026-08-10T21:10:57.025080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05196","last_updated":"2024-07-16T01:04:36Z","snapshot_observed_at":"2026-07-06T17:56:57.822421Z","submitted_at":"2024-04-08T04:53:29Z","title":"HSViT: Horizontally Scalable Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05196","snapshot_observed_at":"2026-08-10T21:10:56.797560Z","title":"Hsvit: Horizontally scalable vision transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.797560Z"},"links":{"cited_paper":"/paper/2404.05196","citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:74abecac4d40bf71ced200013d03242e5b6fee714fee9c1761bb2af4ac8be4a4","observation_id":"31d56063-3ce1-4c6c-a556-0df5c807b16d","resolution":{"observed_at":"2026-08-10T21:10:56.797560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:56.999573Z","title":"Convit: Improving vision trans- formers with soft convolutional inductive biases","venue":null,"work_id":"a0f7cdd5-996b-4ecb-8c48-4e47ccd36201","year":2021},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.802176Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:539f675fd566eb2c0f9277ba4b930476b18501cc7e136194fb1106f83ac711a5","observation_id":"a00105af-d7a3-4fcd-ba86-7aa44b2102bb","resolution":{"observed_at":"2026-08-10T21:10:57.008298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:56.979891Z","title":"Cmt: Convolutional neural networks meet vision transformers","venue":null,"work_id":"8324cfdc-2f52-4e19-9893-a2f0bb72ddd2","year":2022},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.806202Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:5563270144681063000dda118fc01eddd9b4a6c44d3712d8d2b113998ea6f000","observation_id":"9c82218d-b0da-4e58-b765-53336691089f","resolution":{"observed_at":"2026-08-10T21:10:56.984650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:56.966995Z","title":"Levit: a vision transformerinconvnet’sclothingforfasterinference","venue":null,"work_id":"1a17a3d2-0de3-41f2-9095-2de293cb41cd","year":2021},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.810573Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:a151d7ca832e8ec4d99fe7cdc5f9f82d798a73e0e2bdb2a9cc679e265ff34f12","observation_id":"ef259d15-aec4-43f3-a89a-736592e42d7c","resolution":{"observed_at":"2026-08-10T21:10:56.971354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:56.948405Z","title":"Shunted self-attention via multi-scale token aggregation","venue":null,"work_id":"8de84e42-0339-47ca-8907-fef28c80c432","year":2022},"citing_paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:56.814914Z"},"links":{"citing_paper":"/paper/2501.06040"},"observation_digest":"sha256:03c3c8f3e50f5eca4dc8ad9c06310a07fda530899432757c3db36af764b463b7","observation_id":"8f5fa47e-00b1-450b-9528-e22d15fe1deb","resolution":{"observed_at":"2026-08-10T21:10:56.956871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.06040","last_updated":"2025-01-14T14:33:55Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T00:45:10.479205Z","submitted_at":"2025-01-10T15:18:05Z","title":"MSCViT: A Small-size ViT architecture with Multi-Scale Self-Attention Mechanism for Tiny Datasets"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2501.06040."}