{"as_of":"2026-08-14T17:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df77180456f215fa243db85e62a2fc91f51c21309a9c625318211d10e470fff2","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:58:23.640265Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T16:59:10.670721Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"cited_work":{"arxiv_id":"2509.08959","doi":"10.48550/arxiv.2509.08959","metadata_source":"pith","pith_arxiv_id":"2509.08959","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","venue":"cs.CV","work_id":"a7c329cc-226d-4a81-963d-e2f7509883c1","year":2025},"citing_paper":{"arxiv_id":"2605.12168","last_updated":"2026-05-12T14:16:05Z","snapshot_observed_at":"2026-08-12T13:39:42.912938Z","submitted_at":"2026-05-12T14:16:05Z","title":"On What We Can Learn from Low-Resolution Data","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-13T05:28:50.993737Z"},"links":{"cited_paper":"/paper/2509.08959","citing_paper":"/paper/2605.12168"},"observation_digest":"sha256:d6968a3ab86420681c4922c7614655a902e9ea88ea6b7a89b3fe9691aceedfbd","observation_id":"a09d9311-4512-4275-bea1-ee236fc6dca1","resolution":{"observed_at":"2026-05-13T05:32:19.003732Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08959","snapshot_observed_at":"2026-07-11T17:32:24.547251Z","title":"Coswin: Convolu- tion enhanced hierarchical shifted window attention for small-scale vision.arXiv preprint arXiv:2509.08959, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04548","last_updated":"2026-07-05T23:36:36Z","snapshot_observed_at":"2026-08-13T03:11:33.707770Z","submitted_at":"2026-07-05T23:36:36Z","title":"Explainable Novel Category Discovery in Semantic Concept Space","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T17:32:24.547251Z"},"links":{"cited_paper":"/paper/2509.08959","citing_paper":"/paper/2607.04548"},"observation_digest":"sha256:3400ab8d1afcd37c0cfed771ad88533fb5b2256282aa82b66237470b7e2d0824","observation_id":"50677973-488d-40d3-8a22-3ceaa014c91a","resolution":{"observed_at":"2026-07-11T17:32:24.547251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"cited_work":{"arxiv_id":"2509.08959","doi":"10.48550/arxiv.2509.08959","metadata_source":"pith","pith_arxiv_id":"2509.08959","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","venue":"cs.CV","work_id":"a7c329cc-226d-4a81-963d-e2f7509883c1","year":2025},"citing_paper":{"arxiv_id":"2607.07903","last_updated":"2026-07-08T20:31:06Z","snapshot_observed_at":"2026-08-07T02:48:01.295589Z","submitted_at":"2026-07-08T20:31:06Z","title":"Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-10T15:42:46.392593Z"},"links":{"cited_paper":"/paper/2509.08959","citing_paper":"/paper/2607.07903"},"observation_digest":"sha256:33ca5ad442a4223cea373a452dfe286b891ce7a2f3b11f40875a4f05efae1e8a","observation_id":"9826756c-7d04-4d67-abcb-0816e0db9894","resolution":{"observed_at":"2026-07-10T15:47:23.210188Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08959","snapshot_observed_at":"2026-08-01T12:21:52.686084Z","title":"Coswin: Convolution enhanced hierarchical shifted window attention for small-scale vision,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19590","last_updated":"2026-07-21T21:31:14Z","snapshot_observed_at":"2026-08-14T13:06:40.694700Z","submitted_at":"2026-07-21T21:31:14Z","title":"Learning to Transmit: Volatility-Aware Predictive Communication for Energy-Efficient IoT Networks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T12:21:52.686084Z"},"links":{"cited_paper":"/paper/2509.08959","citing_paper":"/paper/2607.19590"},"observation_digest":"sha256:864f2531bab0769db8df47a39fa73df4eed748ec0597b5014ab07861d9e2e45c","observation_id":"2b8d50db-955d-4846-9f4e-c242f59dad95","resolution":{"observed_at":"2026-08-01T12:21:52.686084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08959","snapshot_observed_at":"2026-08-08T16:59:10.670721Z","title":"Coswin: Convolution enhanced hierarchical shifted win- dow attention for small-scale vision,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-10T09:53:22.175094Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.670721Z"},"links":{"cited_paper":"/paper/2509.08959","citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:6a756f1438467f44801c24a08d4646195a17a6767cee1d9e9e33696f2d74da51","observation_id":"17e6e87b-f390-4c29-88ef-d4a356b0cd8e","resolution":{"observed_at":"2026-08-08T16:59:10.670721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.08959/citation-record","integrity":"/paper/2509.08959/integrity","json":"/paper/2509.08959/citation-record.json","paper":"/paper/2509.08959"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:19.255808Z","title":"Gradient-based learning applied to document recognition,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:19.255808Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:967c6819b5fd37326ec80dd77381ccf0547adc5660e417609b3566f695f376fe","observation_id":"7b6cb07b-8ec2-4f1f-8404-cae2df7425d1","resolution":{"observed_at":"2026-08-04T19:58:19.255808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:19.330381Z","title":"You only look once: Unified, real-time object detection,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:19.330381Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:fc7cc7773cc8f579552de8790a938b579a4492bb2fbd25217d49d8f0784cd82f","observation_id":"ae41014f-b0fe-4d1b-9509-51f6ff42bd5f","resolution":{"observed_at":"2026-08-04T19:58:19.330381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:19.371850Z","title":"Fully convolutional net- works for semantic segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:19.371850Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:4876faf3a333514c5b14255b6bdf4ad9233fa903fa6949a143fe38e8a36a2420","observation_id":"38eda33b-4bd1-4e7a-876e-a32da7f61e8e","resolution":{"observed_at":"2026-08-04T19:58:19.371850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:19.447595Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:19.447595Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:da775fe975db3c78ed9a4b8f72249fe094c4bc735564a4ba57a0a3f175bd37af","observation_id":"2ab2c3c4-d64a-4763-8937-0a9102f9aa72","resolution":{"observed_at":"2026-08-04T19:58:19.447595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:19.527808Z","title":"Densely connected convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:19.527808Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:8ca286bb97a5a4fe72dea0270275cf1b0688c2c89f9436aeb9e8eee92ee0ca0b","observation_id":"011244c0-1a9f-42d2-8a4e-acd96c75ac11","resolution":{"observed_at":"2026-08-04T19:58:19.527808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:19.600677Z","title":"Xception: Deep learning with depthwise separable convolutions,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:19.600677Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:9e5aff87181d1d764b20167fd1fbdc6d28ef93998d138ecee33bd40de7cd346a","observation_id":"e8318e24-16cb-4644-b411-fb9c9f2d7a45","resolution":{"observed_at":"2026-08-04T19:58:19.600677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:19.677480Z","title":"Aggregated resid- ual transformations for deep neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:19.677480Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:b00435d133952c786e171079d4b6435c6e14b07f56b7c13d74a866af8dbb7331","observation_id":"d5132a38-0f1e-452d-9289-e4dc8f37b167","resolution":{"observed_at":"2026-08-04T19:58:19.677480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:19.754796Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:19.754796Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:573a63a3728c453f66481fb313fef4bb920bfd187e8935a26cbebff976f25751","observation_id":"ef5fbdb6-cb8c-404b-981e-24fa05e96d78","resolution":{"observed_at":"2026-08-04T19:58:19.754796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:19.846958Z","title":"Bert: Pre- training of deep bidirectional transformers for language un- derstanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:19.846958Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:405bbc9590a22305d80e57682685723da7a09e98443bf842cfd5ce348341cd6a","observation_id":"06474b49-8cdf-423f-9272-1e856de123a7","resolution":{"observed_at":"2026-08-04T19:58:19.846958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:19.962687Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:19.962687Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:8909308ec44648ec669a03b96ccecbcb489f79f29cb7f7435cddae94c81e93b8","observation_id":"370fda7b-97ed-40c6-b0ca-18d8ce88a26e","resolution":{"observed_at":"2026-08-04T19:58:19.962687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-04T19:58:20.095214Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:20.095214Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:65848680fef76829c6bdae52cc427613f5cb350081f3a799c141ae14d0a9b92b","observation_id":"8df30c06-ea15-40a7-ba71-6a64bbfd3f37","resolution":{"observed_at":"2026-08-04T19:58:20.095214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:20.207832Z","title":"Atten- tion augmented convolutional networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:20.207832Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:829877159bb40fe663a4f562ec459b76ff370f7356d9403e1e1a4fe266b8cfdb","observation_id":"6ece51b2-4642-4a8a-b4de-09af37958658","resolution":{"observed_at":"2026-08-04T19:58:20.207832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:20.270129Z","title":"Exploring self-attention for image recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:20.270129Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:6f10874063b8727fed9c7f3e98a987b083bbe3aa193f25044ae21488a079b37b","observation_id":"4cfe69b0-0088-499c-aa26-63320b1ec7e3","resolution":{"observed_at":"2026-08-04T19:58:20.270129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:20.407792Z","title":"Bottleneck transformers for visual recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:20.407792Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:5b39bed21e20a1be4b7a4e34b9f81e9e370afc8945c5aa7fbdc8f525340fb4f2","observation_id":"f6947403-24c8-4a08-91c6-89a330ce96c4","resolution":{"observed_at":"2026-08-04T19:58:20.407792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:20.483094Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without convolutions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:20.483094Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:f113d8fc94d1123d6cfd5dcf7f60c5b4526f6aa0804cad361f19153dd96d6e40","observation_id":"45127c65-f3c9-49ea-94cc-64a5fc1b7cdf","resolution":{"observed_at":"2026-08-04T19:58:20.483094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:20.597971Z","title":"An image is 11 worth 16x16 words: Transformers for image recognition atscale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:20.597971Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:c8fe9199a49951c3715e1f0ac557230a8914d0cc44270408e1c84248c3d80a3c","observation_id":"32ed51ce-4f01-4c91-83cf-e7abdcdc1a5d","resolution":{"observed_at":"2026-08-04T19:58:20.597971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:20.716271Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:20.716271Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:c099d5720abfc316289a2476aa496d5008c4ae1a73a337aaf5cf3b41b6012e1a","observation_id":"3272b451-cf02-447a-a243-c6ee251d4a0c","resolution":{"observed_at":"2026-08-04T19:58:20.716271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:20.845230Z","title":"Transformers in vision: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:20.845230Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:11981b1b40b26ed9922c0afe8ddd18463fb1eee86011d4111d7918f57be9216a","observation_id":"aad4f33b-b6ae-47a5-85f9-0f9c0649db78","resolution":{"observed_at":"2026-08-04T19:58:20.845230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:20.967888Z","title":"Learning multiple layers of features from tiny images,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:20.967888Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:7691c8a3a1ce73c4ac4194a54175c6745cebcc174c51cf3eb05f52fb27d372e4","observation_id":"8b285519-a0d8-4c86-ad40-09fcf4a2bd1d","resolution":{"observed_at":"2026-08-04T19:58:20.967888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.043477Z","title":"Mnist hand- written digit database,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.043477Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:750b656cc46b2679c9df20ebf23bebb4aafb23366efb030a36f0ca93a70fcc13","observation_id":"c00656e8-4966-489a-89f2-142f39f9c22f","resolution":{"observed_at":"2026-08-04T19:58:21.043477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.098298Z","title":"Reading digits in natural images with unsupervised fea- ture learning,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.098298Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:2111904eae984a4822ba1ab819322971826160ff6503bbac0bac567fbcc6ed22","observation_id":"ba0a7cc1-b58f-41fc-9e50-ed22450ebab6","resolution":{"observed_at":"2026-08-04T19:58:21.098298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.186955Z","title":"Imagenet classifi- cation with deep convolutional neural networks,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.186955Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:9603b66678f7a937d8d90f6b0cd22a6f06f70e85e8acb804c2a2cc3108d79a00","observation_id":"7bde9a5d-778e-4352-bb9f-f33afddafd29","resolution":{"observed_at":"2026-08-04T19:58:21.186955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.320164Z","title":"Very deep convolutional net- works for large-scale image recognition,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.320164Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:4a7263f7e4b7982bc4b8fbc6575af26681c209bdc59852946482dd943b91527b","observation_id":"893092e9-68dc-4353-848c-9881718dd95f","resolution":{"observed_at":"2026-08-04T19:58:21.320164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.368564Z","title":"Multi-scale context aggregation by dilated convolutions,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.368564Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:439ce776ea51d9e4197acbc27073f9ef1696543e38a3543e048feb549c51b936","observation_id":"416b5520-827e-4a3d-b008-8cb088c5b147","resolution":{"observed_at":"2026-08-04T19:58:21.368564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.443513Z","title":"Multiscale vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.443513Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:831c9a378b9508b169db8c9a7afd9ad95186ad473d4ffd2010491356cd8d7084","observation_id":"e50e7dd3-8744-491c-89e9-70b37aea3375","resolution":{"observed_at":"2026-08-04T19:58:21.443513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.499469Z","title":"Mobilevit: Light-weight, general- purpose, and mobile-friendly vision transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.499469Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:cdfc5520a908a58861c89af81c608163115086f26090f8ffc0c4c0cf992eda2c","observation_id":"d3949608-e4b7-4331-8136-059e7f506163","resolution":{"observed_at":"2026-08-04T19:58:21.499469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.620221Z","title":"Flexivit: One model for all patch sizes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.620221Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:79cd5c4f3605665f76bee2784483a610d0d095b0fd1aa65ba057f2bcd6bfb071","observation_id":"5dc68c13-07a7-4c5d-ad9a-9c9ec5b7aec7","resolution":{"observed_at":"2026-08-04T19:58:21.620221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.714747Z","title":"Tokens-to-token vit: Training vision transformers from scratch on imagenet,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.714747Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:30649b1c556a0152b7d5be526fa09570597460b1f27f4f17467feb77d199bce5","observation_id":"0e433f89-acf9-4f75-9556-2eb423a8d439","resolution":{"observed_at":"2026-08-04T19:58:21.714747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.813606Z","title":"Gradient- based learning applied to document recognition,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.813606Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:849d2c194f846ad93427c72f9f6842b08fdfa3887edc02acab1bff0dcad4dbf2","observation_id":"85984bfa-e74b-45b3-837f-5cab33336a8d","resolution":{"observed_at":"2026-08-04T19:58:21.813606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.885306Z","title":"Training data-efficient image transformers & distil- lation through attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.885306Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:00e3104c0dce3339dfec19d7ec439318c4c289c7ad086a428ef87e5b4b241db8","observation_id":"b2ce3c73-afee-4d6d-b70e-cd059d51779a","resolution":{"observed_at":"2026-08-04T19:58:21.885306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.980272Z","title":"Patchrot: Self- supervised training of vision transformers by rotation predic- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.980272Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:d40bb867401a3ece4397e4086966dde1a85bf5fdf72e7535d687a3fd9a19a4a6","observation_id":"19ae81bd-b7d7-4711-9dc6-7a9c320cc921","resolution":{"observed_at":"2026-08-04T19:58:21.980272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13492","last_updated":"2021-12-27T03:24:03Z","snapshot_observed_at":"2026-08-10T01:24:59.733860Z","submitted_at":"2021-12-27T03:24:03Z","title":"Vision Transformer for Small-Size Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.13492","snapshot_observed_at":"2026-08-04T19:58:22.062214Z","title":"Vision transformer for small- size datasets,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:22.062214Z"},"links":{"cited_paper":"/paper/2112.13492","citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:4c943fa214c4756a59dde613ca08c226b52061b3c664750473c08da7cf1156b7","observation_id":"aeed180e-77d6-41d9-8f85-4a90dcdc669e","resolution":{"observed_at":"2026-08-04T19:58:22.062214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:22.202524Z","title":"How to train vision trans- former on small-scale datasets?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:22.202524Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:7b60da32dcd52949404ddd3c625df070cf69d12c2c88ad62a5756ecee70d7414","observation_id":"bbd8b998-3c38-43dd-bcd7-499de343fb7f","resolution":{"observed_at":"2026-08-04T19:58:22.202524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:22.300958Z","title":"Efficient training of visual transformers with small datasets,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:22.300958Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:c2b00efd2a8bba50235edda7ae030b5d7ef77dd692dbbd66f92c6c88e6a5c0e1","observation_id":"d9be1163-4efc-43c1-820b-0fad9d7dc0ac","resolution":{"observed_at":"2026-08-04T19:58:22.300958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-14T05:15:12.190552Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-04T19:58:22.419337Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:22.419337Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:a08565a4980e74948d3e7032b65e918c30eabf0a3ca892264ccb73781d5cdd01","observation_id":"b8dbb594-52d7-4d51-a6da-8a5506b71ad4","resolution":{"observed_at":"2026-08-04T19:58:22.419337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:22.593770Z","title":"Mobilenetv2: Inverted residuals and linear bottlenecks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:22.593770Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:2550c511ddbd94d105ff06180e097ef2660dc602471ef8d1be892ee4ec3574b6","observation_id":"4f0c6291-6b6c-471b-b9da-40339f12a734","resolution":{"observed_at":"2026-08-04T19:58:22.593770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:22.751786Z","title":"Tiny imagenet visual recognition chal- lenge,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:22.751786Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:1c0ebfa1e4432754a364540214e3911484102ff3fd2a111ff77a2b256899c779","observation_id":"ae49ad02-f846-4d9d-bc03-1567cab1e627","resolution":{"observed_at":"2026-08-04T19:58:22.751786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:22.962355Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:22.962355Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:87798f89735d29ed7a3729b4e6961c49f1297af24d44a59d0670c6918ba57540","observation_id":"86f89e18-d072-4d9b-9fb1-70b81e15860d","resolution":{"observed_at":"2026-08-04T19:58:22.962355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-08-08T10:28:19.597631Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-04T19:58:23.022019Z","title":"mixup: Beyond empirical risk minimization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:23.022019Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:dc1376b145400fc2fa24e6ceca01ea727b42ab7f110c2b473bb479ddc2db6add","observation_id":"55d6adfb-4e5e-4e59-9cd7-acf2c3b361af","resolution":{"observed_at":"2026-08-04T19:58:23.022019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:23.159849Z","title":"Cutmix: Regularization strategy to train strong classifiers with localizable features,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:23.159849Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:b1c300cf368c5b7ecfe6827bd46f43bcdb3b0e8921f491f69b5bad7a70195b5e","observation_id":"0fbfd41e-d463-4c0c-b2bd-27125e2c1095","resolution":{"observed_at":"2026-08-04T19:58:23.159849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:23.275838Z","title":"Random erasing data augmentation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:23.275838Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:0626167193d628c55f69eff5afbd1ca941702aeb717bedb43f4791ba0c845c29","observation_id":"190dfc2c-b50b-4fe8-9995-632a8fb63886","resolution":{"observed_at":"2026-08-04T19:58:23.275838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:23.352348Z","title":"Randaugment: Practical automated data augmentation with a reduced search space,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:23.352348Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:420b8befb24551c26c7d105638cab43488ca440d2467f63be729cf33ccea1f90","observation_id":"87f19779-afce-4dd8-8e80-b386dd3815a2","resolution":{"observed_at":"2026-08-04T19:58:23.352348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:23.433983Z","title":"Autoaugment: Learning augmentation policies from data,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:23.433983Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:b07cb4fea99519c9173c74778377ce26875378754f610f4d075ce9d0087511ac","observation_id":"4cd92304-1b43-4771-9991-524098f08d9a","resolution":{"observed_at":"2026-08-04T19:58:23.433983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:23.523857Z","title":"Deep networks with stochastic depth,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:23.523857Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:31bfedfeaf42f3961de4a9bd29fbd62035044a4d3c683b2b3d66b5eca70fb740","observation_id":"88dc4d4d-34da-4b66-9ed9-14e34b0c6f28","resolution":{"observed_at":"2026-08-04T19:58:23.523857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:23.597825Z","title":"Decoupled weight decay regular- ization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:23.597825Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:c2c386b770a30d9aac0c28c0ee63d800d2e351dcd3e7643f3e653cd796cc0568","observation_id":"5cd23f56-9c22-47da-bbb3-115be6dba94b","resolution":{"observed_at":"2026-08-04T19:58:23.597825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:23.640265Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:23.640265Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:3e0d4213bdfb4bd360e63ddf61be3992992a1dc1e150d7b36f99611ef3345bd0","observation_id":"a367bc3f-b7ba-44d8-aebf-0bf9f32fbde5","resolution":{"observed_at":"2026-08-04T19:58:23.640265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T04:22:08.015093Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 5 inbound Pith citation observations for arXiv:2509.08959."}