{"as_of":"2026-08-10T07:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9251f6a2b1cc45f111c18d2ee5de6baa8fbe11cf4dd9e2cabd84e1d4cd5c8f38","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:42:03.479929Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.12982/citation-record","integrity":"/paper/2506.12982/integrity","json":"/paper/2506.12982/citation-record.json","paper":"/paper/2506.12982"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.534247Z","title":"Computing receptive fields of convolutional neural networks","venue":null,"work_id":"5be931a8-e0a7-4b06-b479-205a3a7b1d61","year":2019},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.047124Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:b0755944c946cadadaa616d2b1f9f1f9d0fd85024f9ac184ae2f48451e8a8828","observation_id":"121603b3-c3c8-4fa1-91cb-0d361e9a426d","resolution":{"observed_at":"2026-08-07T00:42:05.536866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.528035Z","title":"Advances in medical image analysis with vision transformers: a comprehensive review","venue":null,"work_id":"76b8d9a2-4fab-42df-aff7-45f35ec716fb","year":2024},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.133965Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:d4ffd0cccccb9899b600a6df0a20116f7daec3f11a6636116d9455321ea0541d","observation_id":"d9c37fc8-f615-41b0-b61b-32b42d6841be","resolution":{"observed_at":"2026-08-07T00:42:05.530417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.520718Z","title":"Med-former: A transformer based architecture for medical image classification","venue":null,"work_id":"d9fae5ac-5936-4c12-ac58-683b9a7db8d6","year":2024},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.178727Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:d54582b449a5a2da392b1febc4d443a93cbbe1e88225605942cebcc8b36b90ec","observation_id":"298bc71d-fd4c-457e-bb0e-de4202cf6ffd","resolution":{"observed_at":"2026-08-07T00:42:05.523287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.513516Z","title":"Coatnet: Marrying convolution and attention for all data sizes","venue":null,"work_id":"38874d5d-8c10-4215-ab71-6adfa5408dbb","year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.235061Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:950a5f37a9089d3cbfc1c44c56a1d9b24b0b726687ecdf71f26954df99da8a26","observation_id":"e314b164-6d93-4c17-bac4-6063c24cea80","resolution":{"observed_at":"2026-08-07T00:42:05.516390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T00:42:00.295713Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.295713Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:11d77b014462249882053a056c605bdbd5d002fd8a5054b75ca7d5bca7237754","observation_id":"50520a72-5c57-44a4-8a2c-aed2f291d68b","resolution":{"observed_at":"2026-08-07T00:42:00.295713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.507135Z","title":"Convit: Improving vision transformers with soft convolutional inductive biases","venue":null,"work_id":"5ff4cc40-c21d-46ac-b499-2b1d2175c4aa","year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.354803Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:1e648ab417b3d74ef3cc3a28dcf323542fa2f846fc7a5db110d4f7630e342237","observation_id":"b3af8723-7c72-4972-8629-18843815f874","resolution":{"observed_at":"2026-08-07T00:42:05.509453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.500313Z","title":"Rmt: Retentive networks meet vision transformers","venue":null,"work_id":"eb0f927f-1e78-4d9f-a26c-5f7ae6e0921a","year":2024},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.411487Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:82002180055a494792c3bc58c70e792b10877f7dcf569dcadffd8d5f68f1ea02","observation_id":"d4639b79-7dd1-4def-b9ba-5baafb7d5221","resolution":{"observed_at":"2026-08-07T00:42:05.502640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.493867Z","title":"Cmt: Convolutional neural networks meet vision transformers","venue":null,"work_id":"08666a5e-1bc4-40b7-af88-cf7f8041a19c","year":2022},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.507518Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:0fab3f1b840640a424932c1d6ec0a185d92d3cd8bc256ac798d0d08c63775286","observation_id":"1f0487c9-c931-4c7b-b903-10e3e60a3165","resolution":{"observed_at":"2026-08-07T00:42:05.496119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.486825Z","title":"Higt: Hierarchical interaction graph-transformer for whole slide image analysis","venue":null,"work_id":"f152a6cc-4dff-4103-9e68-f3f647711d91","year":2023},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.562683Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:5177766457082f38b57217fd04bb5f863bf262ada567b7a5664c3e3531bc2eb0","observation_id":"d4222645-5575-48b0-9e1a-89fe1025b94e","resolution":{"observed_at":"2026-08-07T00:42:05.489171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:00.613900Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.613900Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:774a7a4df922ebee0e32270152d07aae63d7bb7f18491743164adb354d7c3b6e","observation_id":"5f5091d8-991a-4355-94ed-01c3315b7ef6","resolution":{"observed_at":"2026-08-07T00:42:00.613900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.476030Z","title":"Conv2former: A simple transformer-style convnet for visual recognition","venue":null,"work_id":"625edbad-1b82-4ddb-b142-64392f674bc5","year":2024},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.668212Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:5b54e9b2042c3a53ff761b507bbd99a1f18542fc92db19b4818af31e6a929809","observation_id":"def84805-d051-4d8a-bd84-ccae8d84e67e","resolution":{"observed_at":"2026-08-07T00:42:05.478390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:00.721756Z","title":"Benchmarking self-supervised learning on diverse pathology datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.721756Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:46aee2d8b4845da1db313d5fdd5d831b4986e415b4bed06f258f2db5c7a7d18a","observation_id":"92195be2-b7e0-409c-8cb0-cc7e922c4c70","resolution":{"observed_at":"2026-08-07T00:42:00.721756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13492","last_updated":"2021-12-27T03:24:03Z","snapshot_observed_at":"2026-08-10T01:24:59.733860Z","submitted_at":"2021-12-27T03:24:03Z","title":"Vision Transformer for Small-Size Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.13492","snapshot_observed_at":"2026-08-07T00:42:00.774613Z","title":"Vision transformer for small-size datasets","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.774613Z"},"links":{"cited_paper":"/paper/2112.13492","citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:0be3022377aa8104a8e394b680e78b7008ee989973c10e22079c2eae3fbb5a01","observation_id":"9b464d33-8b4f-4436-ac47-0df59a554708","resolution":{"observed_at":"2026-08-07T00:42:00.774613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.465858Z","title":"Mvitv2: Improved multiscale vision transformers for classification and detection","venue":null,"work_id":"e7c6620f-d4c4-43d4-baf0-2cc438531d7d","year":2022},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.855810Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:c95d5f1bbe7c59ee3749bcbbd570c93863def77945080eecb0f85e4373d43d61","observation_id":"3053d9d7-c1e7-44c5-a0a8-de337fa5567b","resolution":{"observed_at":"2026-08-07T00:42:05.468463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.05707","last_updated":"2025-02-12T13:35:59Z","snapshot_observed_at":"2026-08-09T23:57:42.753825Z","submitted_at":"2021-04-12T17:59:22Z","title":"LocalViT: Analyzing Locality in Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.05707","snapshot_observed_at":"2026-08-07T00:42:00.924074Z","title":"Localvit: Bringing locality to vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.924074Z"},"links":{"cited_paper":"/paper/2104.05707","citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:6bb1d31d8b1c1f1c0524d924f2c65a0401910c5c1e3edba857cedee41fbab092","observation_id":"52397976-09f5-4ae8-9038-7b709136d20c","resolution":{"observed_at":"2026-08-07T00:42:00.924074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.459026Z","title":"Scale-aware modulation meet transformer","venue":null,"work_id":"55afa277-41ef-4ed7-9602-51c9a0077ebb","year":2023},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.975737Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:90b5a40d547c7bc9a718e0834576019a91e925724c4c9fc6c2979ffe4427e94c","observation_id":"5f28b332-df95-4833-b04a-638ef511a154","resolution":{"observed_at":"2026-08-07T00:42:05.461660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.452665Z","title":"Exploiting geometric features via hierarchical graph pyramid transformer for cancer diagnosis using histopathological images","venue":null,"work_id":"2b04a276-b76c-4d48-8895-cf0dec689f5b","year":2024},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.050750Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:7a12d33f87fa95b966a3bb55e59213cdea3c4d7e025568d50b997443ccf696af","observation_id":"cdd0b2fb-d693-44db-8011-068cc29c180d","resolution":{"observed_at":"2026-08-07T00:42:05.455126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.446142Z","title":"Efficient training of visual transformers with small datasets","venue":null,"work_id":"f2e2c5de-c78c-4399-8bab-9d237b9027b1","year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.186246Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:4197f3b22fcae18806d01b249f6b42a802157d752b89a1834cf763d083688879","observation_id":"5e1bf034-b649-4439-931d-92c2e631d6c2","resolution":{"observed_at":"2026-08-07T00:42:05.448424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.439136Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"093c8154-c983-4e59-a4cb-1bc6659a6fc9","year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.293237Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:c31d78b0b6d81927ac41d7b4cb9d7c37a518a00878ecedee9e0fc74836b27c90","observation_id":"3f4df035-9a75-439e-a79c-e617f38d61ce","resolution":{"observed_at":"2026-08-07T00:42:05.441813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.432426Z","title":"Hybrid ladder transformers with efficient parallel-cross attention for medical image segmentation","venue":null,"work_id":"4bac9f46-cb2f-445b-91b3-8bfb2801f831","year":2022},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.341331Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:0c7c8c9ea9fc302760d0ae076c27e9791e445ac00180d25e1de0935ef7844f6f","observation_id":"eeb6cd80-34e1-48e8-8777-2d5faebc73f0","resolution":{"observed_at":"2026-08-07T00:42:05.434969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.425530Z","title":"Medvit: a robust vision transformer for generalized medical image classification","venue":null,"work_id":"858f52e3-51a6-4410-a8ae-9a0fbdd62c5b","year":2023},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.430781Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:573dde335a1221535451ad2b5822997a9136fa8be18ea5899fb3298c3e6412d8","observation_id":"65557212-abf7-4534-b817-70631fa746e1","resolution":{"observed_at":"2026-08-07T00:42:05.428180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.398333Z","title":"Cell-detr: Efficient cell detection and classification in wsis with transformers","venue":null,"work_id":"027e60c0-f743-4dcb-8561-ad6ea66dd426","year":2024},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.662919Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:67f0c635aba9bb653b51a2d018983835eb50b961de6ab574986e490131861486","observation_id":"18ce1c21-9bc2-4adc-b51f-0a62698bd0cb","resolution":{"observed_at":"2026-08-07T00:42:05.421183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.218840Z","title":"Do vision transformers see like convolutional neural networks? Advances in neural information processing systems, 34: 0 12116--12128, 2021","venue":null,"work_id":"ddb71c7e-976e-429e-9bac-f364cec78430","year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.795141Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:4c9f587b0e49c3b5e4269e7c78cd338078bc2150e90b7f523feb73b94d784817","observation_id":"00624969-f0c4-4b55-8cff-7f266306305d","resolution":{"observed_at":"2026-08-07T00:42:05.305020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.111677Z","title":"Transformers in medical imaging: A survey","venue":null,"work_id":"f3e0f05e-6e31-466f-bdb0-c0cda8b20ced","year":2023},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.938556Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:cfccedcea60c635df22f157a723fcae1a03642f7c2fd4fa4d9e7f891bcdd115e","observation_id":"78f39b2a-4334-4bc3-8079-eb6aa7f762a9","resolution":{"observed_at":"2026-08-07T00:42:05.209668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:04.901005Z","title":"Transmil: Transformer based correlated multiple instance learning for whole slide image classification","venue":null,"work_id":"a573f721-74a1-4000-8dc3-c0bee0a6b6fc","year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:02.070143Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:45d4d823f4f6deb5ece7217bf3632fcf1467b5322d4f4f68340b44efc5c6330e","observation_id":"7469ffd3-ae0c-49b7-9e3e-835abbd6deea","resolution":{"observed_at":"2026-08-07T00:42:04.989612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:04.687808Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"2cef2019-0235-467d-9fef-a7b2c04f08f3","year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:02.235797Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:53cc8871304b6460e4c7971d8efc089a73cce11608eb5a43f9013e9eb0d6591f","observation_id":"92a00660-ca49-474d-9aae-997f94d1973c","resolution":{"observed_at":"2026-08-07T00:42:04.786575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:04.437049Z","title":"Uctransnet: rethinking the skip connections in u-net from a channel-wise perspective with transformer","venue":null,"work_id":"756830db-44e8-4144-af20-2b8a55bb53f2","year":2022},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:02.352240Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:b5a0d95e118ea756fa947bde42883cb9cb97deb230ad8b72b48426d9328e7e22","observation_id":"0c0b9d61-4cf6-4e23-a466-f9b00e5cca5a","resolution":{"observed_at":"2026-08-07T00:42:04.591573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:02.553062Z","title":"The cancer genome atlas pan-cancer analysis project","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:02.553062Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:f4be1f4654f8897b8fd8ef142a770d1d0d76d7b52312c81fca6ee22e195bbddf","observation_id":"121df421-3e5a-4ac0-afa0-34baf9cc7704","resolution":{"observed_at":"2026-08-07T00:42:02.553062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:04.279135Z","title":"Cvt: Introducing convolutions to vision transformers","venue":null,"work_id":"bee7c88b-55c4-4681-b0ec-08debee8be97","year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:02.701230Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:80f48a74b3cc8d2ae6d3de8e720bee3f978e3ba0ecbdfe29affb6dc01bf9c3d5","observation_id":"2ea0001f-c4b9-4962-9c5b-63b9e7cdde7c","resolution":{"observed_at":"2026-08-07T00:42:04.415585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:04.055099Z","title":"Co-scale conv-attentional image transformers","venue":null,"work_id":"7ed6065f-28f5-4cc0-84b1-55af6391f62f","year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:02.815883Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:9e82b598c4c9da780746f093245d2fc6e04ea8917f93402e96e296c69e3c0e27","observation_id":"5b54213b-59f5-44c4-a77a-9f180444fed0","resolution":{"observed_at":"2026-08-07T00:42:04.170358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:03.891533Z","title":"Incorporating convolution designs into visual transformers","venue":null,"work_id":"bfa3a62b-5edb-4f38-a313-eccd03f0fed3","year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:02.981271Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:b34e0794aacb75d2e8c99511f914f2429a1b06f03d36e92b43eaa8ea25587b40","observation_id":"22ee1fca-c355-4cad-817c-890a6cf07767","resolution":{"observed_at":"2026-08-07T00:42:03.960318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06978","last_updated":"2024-11-13T10:29:01Z","snapshot_observed_at":"2026-08-10T06:27:55.880633Z","submitted_at":"2023-12-12T04:38:30Z","title":"CLASS-M: Adaptive stain separation-based contrastive learning with pseudo-labeling for histopathological image classification","version":4},"cited_work":{"arxiv_id":"2312.06978","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.06978","snapshot_observed_at":"2026-08-07T00:42:03.652437Z","title":"CLASS-M: Adaptive stain separation-based contrastive learning with pseudo-labeling for histopathological image classification","venue":"cs.CV","work_id":"cfe1fc73-1d09-4c78-a75f-207b0b3530fa","year":2023},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:03.137920Z"},"links":{"cited_paper":"/paper/2312.06978","citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:c8dcb5c689f43508e448431f220cfe08ee85627d11781c1641f818032c044ec6","observation_id":"7267ffd3-39ec-4805-a027-f49bd04c39d4","resolution":{"observed_at":"2026-08-07T00:42:03.788724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:03.322168Z","title":"Crossformer: Transformer utilizing cross-dimension dependency for multivariate time series forecasting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:03.322168Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:71f2f399d427038b76623dbb958605e1f95a54503605b307ab685286a9027adc","observation_id":"002b6ea9-b74b-47ae-ab6c-537edb0442c0","resolution":{"observed_at":"2026-08-07T00:42:03.322168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-07-06T10:02:45.105181Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-07T00:42:03.479929Z","title":"Deformable detr: Deformable transformers for end-to-end object detection","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:03.479929Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:318ae8e7934a2e8afddd7bbf0d0f25a46fa4b126ea83270fe557864a8af67329","observation_id":"edb0aeb1-3b24-468a-9ba1-c8724a95bdc9","resolution":{"observed_at":"2026-08-07T00:42:03.479929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T01:25:11.198426Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":25},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2506.12982."}