{"as_of":"2026-08-10T04:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:349428028cb27434005588abfc3a73595763795d767d7ef285b57423281b1563","coverage":[{"denominator":93,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":93,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:43:59.305859Z","state":"measured"},{"denominator":93,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":93,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23694/citation-record","integrity":"/paper/2505.23694/integrity","json":"/paper/2505.23694/citation-record.json","paper":"/paper/2505.23694"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1612.03801","last_updated":"2016-12-13T12:19:48Z","snapshot_observed_at":"2026-07-06T05:22:21.129782Z","submitted_at":"2016-12-12T17:32:49Z","title":"DeepMind Lab","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03801","snapshot_observed_at":"2026-08-07T12:43:53.243230Z","title":"Deepmind lab","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.243230Z"},"links":{"cited_paper":"/paper/1612.03801","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:d5b225e1528ab059f864a93dcf6d07549202c17273d1bc78df431747a703ce21","observation_id":"677721b7-0231-4b2d-a17d-2abc1e478198","resolution":{"observed_at":"2026-08-07T12:43:53.243230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.354463Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.354463Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:795cbb1a3be70d1a104f2316bb00d36173b491cb68dbbced42272b9b9f7437bc","observation_id":"aba3a180-d93f-47a1-9ec9-a81c3d7599b9","resolution":{"observed_at":"2026-08-07T12:43:53.354463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07967","last_updated":"2023-10-16T15:52:20Z","snapshot_observed_at":"2026-08-09T19:05:22.405576Z","submitted_at":"2023-06-13T17:59:32Z","title":"One-for-All: Generalized LoRA for Parameter-Efficient Fine-tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07967","snapshot_observed_at":"2026-08-07T12:43:53.447915Z","title":"One-for-all: Generalized lora for parameter- efficient fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.447915Z"},"links":{"cited_paper":"/paper/2306.07967","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:d81cf1dc74bb1d63f995a493add6e2f1a27312e0187d0f4de8bbb0d8eef49dd7","observation_id":"5b16eae0-3f85-4de5-b389-b9d959349518","resolution":{"observed_at":"2026-08-07T12:43:53.447915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.496800Z","title":"Adaptformer: Adapting vision transformers for scalable visual recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.496800Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:c81f5136dfd342b59255d0c99812c54456917082cf2aa6ad7f3fd50916943c2f","observation_id":"1f7c3ce4-9231-4410-bda4-dfb1316dc0f7","resolution":{"observed_at":"2026-08-07T12:43:53.496800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.555873Z","title":"An empiri- cal study of training self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.555873Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:775925e7ba2087a135dd0f2c6edd7217c1e2075d42d2eef7e5d2cb394cb34f7a","observation_id":"9101cb3d-2e76-4184-813e-e2dd98ed3b5e","resolution":{"observed_at":"2026-08-07T12:43:53.555873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.650122Z","title":"Person re-identification by multi-channel parts-based cnn with improved triplet loss function","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.650122Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:d2ec069c87ebd4d3c4a40456468ccb8e75f21a62ed25f2ef1534b4ff4a301a02","observation_id":"55393677-eef1-44cf-91f5-77fef663ab60","resolution":{"observed_at":"2026-08-07T12:43:53.650122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.693115Z","title":"Remote sensing image scene classification: Benchmark and state of the art","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.693115Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:ed3307064bb145c0410b30e0a663cbeb29cdba2b4f60e8ad270e3fa0d0951e13","observation_id":"38fed550-e6dd-4a28-8f3d-1d513f94dd84","resolution":{"observed_at":"2026-08-07T12:43:53.693115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.720239Z","title":"Learning a similarity metric discriminatively, with application to face verification","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.720239Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:4cf8099af4932bb9e9a71efb227d93fdbc999dd997a7a087c014f32010e7e83a","observation_id":"d38f0733-6bb2-4b21-b284-d502b3f9809a","resolution":{"observed_at":"2026-08-07T12:43:53.720239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.746741Z","title":"Describing textures in the wild","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.746741Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:8fad899dd744e6a0bfb93760bbcd2f838efcda5baef67b7772bda9f9ae31938b","observation_id":"01464c45-02f8-4daa-a081-c3463431fa40","resolution":{"observed_at":"2026-08-07T12:43:53.746741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16362","last_updated":"2021-05-20T14:48:30Z","snapshot_observed_at":"2026-08-09T06:13:20.021836Z","submitted_at":"2020-06-29T20:28:52Z","title":"Multi-Head Attention: Collaborate Instead of Concatenate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16362","snapshot_observed_at":"2026-08-07T12:43:53.773851Z","title":"Multi-head attention: Collaborate instead of concatenate","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.773851Z"},"links":{"cited_paper":"/paper/2006.16362","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:2695f02eb258141875b1b666240c38fa09d0f5d1ade2b16b7e409e85d318bc2e","observation_id":"bfb516be-3d0d-46e4-ad9f-a67f2da0f139","resolution":{"observed_at":"2026-08-07T12:43:53.773851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.849916Z","title":"Vision transformers need registers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.849916Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:ac7b674597842a0f5a889b030d520650d39cb932d0f21b6057aceb0a478e2be3","observation_id":"f6e9cff6-7c0f-4680-9a3b-d68047f984aa","resolution":{"observed_at":"2026-08-07T12:43:53.849916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.933032Z","title":"Scaling vision transformers to 22 billion pa- rameters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.933032Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:a41d2ae0aa49d5ce1655f0350eec6301722bab5393d92ffde59e918be98b9efe","observation_id":"4ca9728c-5bd6-4971-a7c8-89cf203d7b4b","resolution":{"observed_at":"2026-08-07T12:43:53.933032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:54.005721Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.005721Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:166409b872d8e92e174aff34a6f252a29b47b720d443f1b9b4a0a2ec9feef056","observation_id":"c90eedad-4459-445e-8d37-d015af179ace","resolution":{"observed_at":"2026-08-07T12:43:54.005721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T12:43:54.117861Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.117861Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:968b2901fc62317dd4e120bfb0b084252c57bf00035a3a765b303a821ea078f3","observation_id":"6bbfe65f-800c-4823-be42-26f0dc4a3a02","resolution":{"observed_at":"2026-08-07T12:43:54.117861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:54.227208Z","title":"Diabetic retinopathy detection, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.227208Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:f43cc4f37f08ceb492007b3a22730d5b6fbfe5fb2ecc99ef92ab5db8172f0150","observation_id":"a90df567-ae71-49c8-8718-f87a7d02dccc","resolution":{"observed_at":"2026-08-07T12:43:54.227208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:54.465274Z","title":"Hyperbolic vision transform- ers: Combining improvements in metric learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.465274Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:f5197057c7604e517e8207b56a07040065ef74d30508384a8e932aa7ebcec847","observation_id":"f44c77ca-ec96-40d6-b631-60804d4c8e1e","resolution":{"observed_at":"2026-08-07T12:43:54.465274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:54.643366Z","title":"One-shot learn- ing of object categories","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.643366Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:526bf954a569602b9b1b508a613fb406afb58bae92ea9ea18460b9c5756bb7d1","observation_id":"bdf2baef-c4b4-4e98-aac1-73ed51acda74","resolution":{"observed_at":"2026-08-07T12:43:54.643366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:10.445959Z","title":"Compositional prompt tuning with motion cues for open-vocabulary video relation detection","venue":null,"work_id":"e35bc29a-7eda-4eb9-b4fc-6c2cb9eaf528","year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.841027Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:d59d7bd9a33f19aebe6d760a12ffca39bc54212f8b93e91e878404a1b90e928b","observation_id":"e2fa0ccb-83e0-441e-869b-7f84b3b6db64","resolution":{"observed_at":"2026-08-07T12:44:10.553202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:10.107244Z","title":"Tuning pre-trained model via moment probing","venue":null,"work_id":"5a398b5f-432b-47bf-b3e6-fadf4d556a45","year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.032302Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:ff9dcef8bea109b7550cfb609d216688bbfc098fb7b07987b2b5a233d8ed96ad","observation_id":"c7613d4e-f0a6-43ea-8c2b-140b3af03e98","resolution":{"observed_at":"2026-08-07T12:44:10.238548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04831","last_updated":"2022-11-30T19:22:22Z","snapshot_observed_at":"2026-08-04T13:02:31.952282Z","submitted_at":"2022-10-10T16:45:13Z","title":"Visual Prompt Tuning for Test-time Domain Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.04831","snapshot_observed_at":"2026-08-07T12:43:55.097072Z","title":"Vi- sual prompt tuning for test-time domain adaptation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.097072Z"},"links":{"cited_paper":"/paper/2210.04831","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:c1ea3acc689bb767068058ceba37c7505227495c4f1a075ce4a78c92ae7f6f01","observation_id":"860ad188-954c-49d5-8fca-2bc260b339fd","resolution":{"observed_at":"2026-08-07T12:43:55.097072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:09.759460Z","title":"Fine-grained car detection for visual census estimation","venue":null,"work_id":"d5a09ce8-7fc3-4f41-954c-b35e382b81d2","year":2017},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.153690Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:331a1290cf234c0bf373f77bb537515485ec16223c5f893f564c34aa24c37b8f","observation_id":"3b436858-e9b8-4d65-aa87-96054e12f293","resolution":{"observed_at":"2026-08-07T12:44:09.940305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:09.643839Z","title":"Vision meets robotics: The kitti dataset","venue":null,"work_id":"b9fa955b-052f-4052-a3d6-bd7ba10ecb9a","year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.197595Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:07f0323075d6a6f7fd999bc4b36483bc6b4e2748aa4f17ec6af8dba1dc7fb98a","observation_id":"a55a0541-7aa2-44c9-8f3e-0aa5a2929e66","resolution":{"observed_at":"2026-08-07T12:44:09.687778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:09.579172Z","title":"Dimension- ality reduction by learning an invariant mapping","venue":null,"work_id":"d3a42aca-e524-4d17-a221-e6d096d83a78","year":2006},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.232085Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:89df15949df375e3db462660da436e82bc0e8bcb73976ca6534884b52548c539","observation_id":"e12a67d2-b294-4f1a-86cb-7d86ba1dcbbd","resolution":{"observed_at":"2026-08-07T12:44:09.604559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13770","last_updated":"2023-07-25T19:03:21Z","snapshot_observed_at":"2026-07-06T15:58:31.756298Z","submitted_at":"2023-07-25T19:03:21Z","title":"E^2VPT: An Effective and Efficient Approach for Visual Prompt Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13770","snapshot_observed_at":"2026-08-07T12:43:55.265616Z","title":"Eˆ 2vpt: An effec- tive and efficient approach for visual prompt tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.265616Z"},"links":{"cited_paper":"/paper/2307.13770","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:c124adec1827ee845832d5d50c3a7c4209f7acbeadaf33415d237083f16495cb","observation_id":"77a4a302-746c-4f4a-b635-0e337b623cec","resolution":{"observed_at":"2026-08-07T12:43:55.265616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:09.243116Z","title":"Sensitivity-aware visual parameter-efficient fine- tuning","venue":null,"work_id":"9f5ab056-854e-4972-b1a9-367774ca3090","year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.330859Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:5d5feeac68a385ca6b5b8cce18a1b444a768bee820f29ad0a884592d1fe05ccc","observation_id":"0d863e50-386c-45ad-8be9-1ec35774e043","resolution":{"observed_at":"2026-08-07T12:44:09.444254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:09.137297Z","title":"Momentum contrast for unsupervised visual repre- sentation learning","venue":null,"work_id":"b16855cd-45f8-486d-9a05-f5e33b1f039d","year":2020},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.458686Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:184dd9be8bb65ba14f542bb0a62272d2cd65a29ab86e2a080162049e662352c8","observation_id":"b48e7034-f3e5-4563-b719-2334906f7148","resolution":{"observed_at":"2026-08-07T12:44:09.148989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:08.936144Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"8bcdb9ea-905b-4c18-a2de-ca2a0f3f50da","year":2022},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.601452Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:80649f78e5056905fac1a149de07c140c5496be9378baae6cd9cec71c9c0b32b","observation_id":"21759ce3-9d1f-4acc-b2d7-95ca9c39af52","resolution":{"observed_at":"2026-08-07T12:44:09.050087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:08.744172Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"afcc38cb-7728-4b63-aec8-0973515cf587","year":2022},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.724042Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:4d94ac07f1804a750b92257c70b67cb0654ba2d3872e487d5f74078e28514dd4","observation_id":"0e816183-ed07-4c8d-85a9-64742e0f8b09","resolution":{"observed_at":"2026-08-07T12:44:08.814671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:08.536247Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification","venue":null,"work_id":"55c7bcb5-f63d-4663-a6f7-03a9355e3d87","year":2019},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.877820Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:10a9bf20269aac5f56ec31c466383331ad4753453d189bcc53114c4840970b12","observation_id":"b977ee6b-06f6-4073-882e-9886bfd1031d","resolution":{"observed_at":"2026-08-07T12:44:08.641837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.07737","last_updated":"2017-11-21T15:35:07Z","snapshot_observed_at":"2026-08-04T09:19:45.912586Z","submitted_at":"2017-03-22T16:34:29Z","title":"In Defense of the Triplet Loss for Person Re-Identification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.07737","snapshot_observed_at":"2026-08-07T12:43:55.983473Z","title":"In defense of the triplet loss for person re-identification","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.983473Z"},"links":{"cited_paper":"/paper/1703.07737","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:e4e66a4ae54bdd50561b47c8de5d33064123dc477b4d329bc7cbac3683a6f189","observation_id":"a1cf976c-002a-4184-b844-dba8d49839a2","resolution":{"observed_at":"2026-08-07T12:43:55.983473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:08.380731Z","title":"Parameter-efficient transfer learning for nlp","venue":null,"work_id":"8cc02338-7f56-4d67-8387-9d2c6d6a9623","year":2019},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.095416Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:ab79802bda82a2d21566833b421ccf5317b22f1999b83d99178ce32a5e1cc5ea","observation_id":"560b98a4-436c-4765-9d16-308fd35a0479","resolution":{"observed_at":"2026-08-07T12:44:08.446640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T12:43:56.160452Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.160452Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:94a19ce4850504a3bcfb65be7e4eed7f2972adebbe2683770b99d664c660ebb2","observation_id":"2872f899-0a69-4ade-8716-682d8e621b8d","resolution":{"observed_at":"2026-08-07T12:43:56.160452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:08.178782Z","title":"Visual prompt tuning","venue":null,"work_id":"223b2028-02d4-4aca-bb7e-645b98baa2ef","year":2022},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.239481Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:122574276d766f084487729597f1e790386f650a76d032ce387e1ff219dc4348","observation_id":"c28fb6db-b620-46d1-8d34-05dffb05625d","resolution":{"observed_at":"2026-08-07T12:44:08.274239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.997326Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":"58ce373a-fb4e-471c-98dd-a840d9f46f85","year":2017},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.305926Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:25beed2d6ac244e13f29c23b476619655cc8d5543decadaf2c6c7a53ebb5b232","observation_id":"98a688f4-09c0-463a-a810-a8c9ea480bcb","resolution":{"observed_at":"2026-08-07T12:44:08.092087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.837787Z","title":"Novel dataset for fine-grained image cat- egorization: Stanford dogs","venue":null,"work_id":"a637a2b7-ca61-4546-a247-6c1a141626ba","year":2011},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.340283Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:d4c11b4329b7627755592c56b3883aed6cfa2be067b7fb62d7afa6001253354f","observation_id":"1df2de5d-40d4-4e26-ad80-7eedeef21e08","resolution":{"observed_at":"2026-08-07T12:44:07.914276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.683913Z","title":"Proxy anchor loss for deep metric learning","venue":null,"work_id":"9af21371-546d-4883-a4a7-e522f3849e10","year":2020},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.372914Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:d64c895142d8018b9b753749a6b9b5de5766fef935530d5b684e3310d9ba1d61","observation_id":"fa9c95c4-a588-4818-9234-1754c5517054","resolution":{"observed_at":"2026-08-07T12:44:07.748700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.525496Z","title":"Segment any- thing","venue":null,"work_id":"58311b61-e24c-45ab-af33-6a41c0a517f7","year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.411533Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:c9716766cc1611ae0df942f0a5f6268143cdb22038ff66d01c2cb277302e14b4","observation_id":"3d871d69-f182-4ea7-a7f1-83cc138b3ab0","resolution":{"observed_at":"2026-08-07T12:44:07.595671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.407863Z","title":"Do better imagenet models transfer better? In CVPR, pages 2661–2671,","venue":null,"work_id":"4abf98af-fdcb-469d-a75f-147cd41641bb","year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.446524Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:ec6eadeeaf05ddd78a9fdff356e2675f8021dbda8df55d4cfbf32e7b731e86ff","observation_id":"45bc8ba1-88f6-4371-83c0-613f625a3b2f","resolution":{"observed_at":"2026-08-07T12:44:07.464445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.264033Z","title":"Cross-image-attention for conditional embeddings in deep metric learning","venue":null,"work_id":"8cce1d8e-d9a4-4f28-9cee-f6e07485e9e5","year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.478169Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:304dd424f24c5a522599735ce9f6dd55f57352cf444bdc4cd7c522d34d1683e0","observation_id":"81d218bf-06ed-45c5-b984-2e6a919a41a4","resolution":{"observed_at":"2026-08-07T12:44:07.346793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.515803Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.515803Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:767c4f2b6ab203d1bf5038af8e507335f4f63b5a7ff9f27890a933343860a64b","observation_id":"f56611e8-5d4e-443d-a5cc-3975ab908f6c","resolution":{"observed_at":"2026-08-07T12:43:56.515803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.058514Z","title":"M-adda: Unsuper- vised domain adaptation with deep metric learning","venue":null,"work_id":"9268fd09-0433-4b5a-9b3a-e1870d0200eb","year":2020},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.546889Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:e38054606eebd958be66ef5265247f185097ee116fdf11b0008914564cae065c","observation_id":"f891f798-fecc-421b-b1d7-d0f7cba37879","resolution":{"observed_at":"2026-08-07T12:44:07.150161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.890669Z","title":"Learning methods for generic object recognition with invariance to pose and lighting","venue":null,"work_id":"5c5c0289-0c73-43aa-8e4e-707b5c77c4a5","year":2004},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.599382Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:983384b62430b0a053d2724fd65955f0f006076c94b6bd23ed4fa4462774c097","observation_id":"5accebdf-bc18-481b-b06c-a6615fb4bf6d","resolution":{"observed_at":"2026-08-07T12:44:06.972304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-07T12:43:56.638598Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.638598Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:8f9625506535dd06651b6c79ac6d1cd2a5f3feaeabcb6de056a31694d36a1043","observation_id":"94779d85-ddee-4ab5-85b9-3ab3fb1da5b6","resolution":{"observed_at":"2026-08-07T12:43:56.638598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-07-06T10:29:18.734092Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-07T12:43:56.691492Z","title":"Prefix-tuning: Optimiz- ing continuous prompts for generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.691492Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:c7d9121ed319cd6e3690b04841191138c3ec08b647862c09ccb0c801f7e2ba1b","observation_id":"5ed6b904-758c-4590-b9fe-82027cec05b6","resolution":{"observed_at":"2026-08-07T12:43:56.691492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.729249Z","title":"Scaling & shifting your features: A new baseline for efficient model tuning","venue":null,"work_id":"2dce7551-5685-4fa9-abff-8e4deb491f14","year":2022},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.733224Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:24b2a546c4c5cdbc5dca6f129b89b79112369e0f262288e299db288a7a51b253","observation_id":"2aa51a31-b82e-4ee7-8b3c-8c0ca3b93693","resolution":{"observed_at":"2026-08-07T12:44:06.804835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.590794Z","title":"Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing","venue":null,"work_id":"0f0f04e0-8b94-4885-a510-4ad451ca54f3","year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.773153Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:0f7edf2a0e1b3a68d0d85efd503377eeaa6411ca6ab3ae7d610195d1b9126828","observation_id":"3e4c7e2f-463e-4d39-b96d-caa93dc2f92c","resolution":{"observed_at":"2026-08-07T12:44:06.649551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07602","last_updated":"2022-03-20T15:13:08Z","snapshot_observed_at":"2026-08-08T11:15:37.346201Z","submitted_at":"2021-10-14T17:58:47Z","title":"P-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07602","snapshot_observed_at":"2026-08-07T12:43:56.805456Z","title":"P-tuning v2: Prompt tuning can be comparable to fine-tuning universally across scales and tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.805456Z"},"links":{"cited_paper":"/paper/2110.07602","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:71df89388610c88245de432b46c2a1b10dac2f85827b146c56d84f88cabee6d1","observation_id":"59ffbfd6-90e6-462a-ac1c-d60ac9294238","resolution":{"observed_at":"2026-08-07T12:43:56.805456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-07T12:43:56.839516Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.839516Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:46f0e38ffae047bb9e7db3a6fd24e1c15bbfc7acd76376fb8e77fd2274dc06e4","observation_id":"b04d707d-e211-40f1-9299-50d17a0d36fe","resolution":{"observed_at":"2026-08-07T12:43:56.839516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T12:43:56.876584Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.876584Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:8e70f42120d6665181122eb5f50d8269177f2873bd0230a43e2567c42dc67b4f","observation_id":"5ac4a9f1-e8d3-447b-889e-376cfcb5dc70","resolution":{"observed_at":"2026-08-07T12:43:56.876584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.385983Z","title":"Exploring the limits of weakly supervised pretraining","venue":null,"work_id":"46eb717f-5f1a-45bc-8a0b-a6f576089bbe","year":2018},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.921079Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:8c552e49553439eace8563c5ea629cddb4ac95864f1da78fd56bd97dbfcead2e","observation_id":"95f17a0e-16bb-45e7-9885-5886444dbbe7","resolution":{"observed_at":"2026-08-07T12:44:06.487771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.221958Z","title":"dsprites: Disentanglement testing sprites dataset,","venue":null,"work_id":"08d0194d-d5da-452c-a1cd-93e0ecb6a72b","year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.986635Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:042e55d227cb4e59f3ec418a61f17119c9949fa877f65561dafc07bcb7cf9357","observation_id":"7beb16f4-ca5b-4c08-ab69-95f76d6f4e25","resolution":{"observed_at":"2026-08-07T12:44:06.303365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.099418Z","title":"The role of context for object detection and semantic segmentation in the wild","venue":null,"work_id":"da90ae61-779e-4d9e-a189-bf43ed244d65","year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.050977Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:718a567d07f89f009bb863803b8c0c98cb87e71a3d0be4fd42bfd68ae1a42f0e","observation_id":"14352b09-ced2-4a7a-824e-0fef3f6720b6","resolution":{"observed_at":"2026-08-07T12:44:06.156880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.975366Z","title":"No fuss distance metric learning using proxies","venue":null,"work_id":"d2816b97-3168-423f-b28f-8e306a7dff84","year":2017},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.108039Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:00947ceab2a073fc3cafef8fddb451bbfa6fdce1af92a8aca86fa170ae4220eb","observation_id":"39208091-70fc-40ca-8fdd-a1ede07b6a38","resolution":{"observed_at":"2026-08-07T12:44:06.027412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.834231Z","title":"Reading digits in natural images with unsupervised feature learning","venue":null,"work_id":"08d404ad-406f-44df-9389-4451bb5b52a0","year":2011},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.169398Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:eeb7f4aede3af02f875a6683b52954b08b057e158e21922ea4d79c03c8162acb","observation_id":"bb22cf29-5a4f-41c4-9f1a-789e52ec2397","resolution":{"observed_at":"2026-08-07T12:44:05.908203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.01091","last_updated":"2019-08-02T23:30:35Z","snapshot_observed_at":"2026-07-06T08:12:08.245649Z","submitted_at":"2019-08-02T23:30:35Z","title":"Toward Understanding Catastrophic Forgetting in Continual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.01091","snapshot_observed_at":"2026-08-07T12:43:57.260298Z","title":"Toward under- standing catastrophic forgetting in continual learning","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.260298Z"},"links":{"cited_paper":"/paper/1908.01091","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:57e365a6bbbe49f38da072bb66b15709362261ec62edca8abeae6f9efc2fabad","observation_id":"62ab5cc6-0682-454f-88f7-952e83e54441","resolution":{"observed_at":"2026-08-07T12:43:57.260298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.741751Z","title":"A visual vocabulary for flower classification","venue":null,"work_id":"7ab17935-eddc-4759-a886-f9fc190a8b16","year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.353812Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:6b4adf1150e590f0cef2d497d429b3a636af586cee0b407d88b39c34fa429bc2","observation_id":"85d8cfd5-9614-4163-a4df-14ba9c80a046","resolution":{"observed_at":"2026-08-07T12:44:05.785326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.553852Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":"71105b5c-af10-4592-a7f7-e589ceb1226e","year":2008},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.431854Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:d3fda9d3c679135570b57ccba53abef3a528dc429ecc986953148bbea4445db2","observation_id":"f6063565-0416-49d9-9545-2eb9d3fe613a","resolution":{"observed_at":"2026-08-07T12:44:05.648466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.367420Z","title":"Cats and dogs","venue":null,"work_id":"d73eed79-8791-423a-b0ae-ba2755a3daa6","year":2012},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.464661Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:7a8e12f86b10e30f11bf7a4cf83c0fd49a9211c738cf0dd09fd02b7b326f7624","observation_id":"3b3802c3-5e01-435e-ba75-31ec905dc8fc","resolution":{"observed_at":"2026-08-07T12:44:05.455728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.189837Z","title":"Recall@ k surro- gate loss with large batches and similarity mixup","venue":null,"work_id":"d0ba80cb-acea-4134-83db-ad7c0b10d0c2","year":2022},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.504160Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:4a169c15555e61207cf32a71652a38054e5118573a79e908c73e31020ce0ac81","observation_id":"638631f6-5034-4032-8264-c92f1063b966","resolution":{"observed_at":"2026-08-07T12:44:05.227498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.071225Z","title":"Sa 2vp: Spatially aligned-and- adapted visual prompt","venue":null,"work_id":"ead48550-cbea-4d3f-8e2e-c58aa1342abd","year":2024},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.542876Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:920b626028dc8ffccc5ff58262a14163a4eeaf2c3d40bd2b650e23451e65b8d3","observation_id":"20375748-78a4-4755-8066-e0fde2e2b664","resolution":{"observed_at":"2026-08-07T12:44:05.127723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.07779","last_updated":"2020-10-06T10:16:39Z","snapshot_observed_at":"2026-07-06T09:38:29.271727Z","submitted_at":"2020-07-15T15:56:05Z","title":"AdapterHub: A Framework for Adapting Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.07779","snapshot_observed_at":"2026-08-07T12:43:57.582656Z","title":"Adapterhub: A framework for adapting transformers","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.582656Z"},"links":{"cited_paper":"/paper/2007.07779","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:1ebbea69654ca08cae4c537f7b132a7683c220cc9d3bb6fe58c0e3dcde451ec8","observation_id":"ef3f914b-6a1b-4d1e-a6ef-692c83799c53","resolution":{"observed_at":"2026-08-07T12:43:57.582656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.913545Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"97ccb3cb-b9f9-4db0-b7d1-2870aa1b12aa","year":2021},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.638434Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:b2438021c5f0521ab7685c740ab9eb0bcf9cfa8c0dba4042e89452da468bda9f","observation_id":"5f65fb55-2faf-475c-a312-8474482af3b2","resolution":{"observed_at":"2026-08-07T12:44:04.988040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.842660Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"259c80b6-a86e-4564-9c49-c23e9337fde0","year":2021},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.685560Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:206571209831d7cf1b8df0b919f5584bd2e2d539642f2d98a5cdcac9409a4b73","observation_id":"6e3b81fc-d614-44b9-a1fa-e55281b0c542","resolution":{"observed_at":"2026-08-07T12:44:04.875175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.748891Z","title":"Beyond the deep metric learning: enhance the cross-modal matching with adversarial discriminative domain regularization","venue":null,"work_id":"c3d696c6-7391-474e-ac25-347b03d0d7f2","year":2021},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.752742Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:6076f258e99fd1b82c6888380a0835e9cedf746ce3ef2435588b4a60ce21d699","observation_id":"35c46f83-d155-438c-8658-0ad72192e968","resolution":{"observed_at":"2026-08-07T12:44:04.783326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.632485Z","title":"To- wards improved proxy-based deep metric learning via data- augmented domain adaptation","venue":null,"work_id":"a7595e9e-c9f7-4da5-a60b-cbfbb3e8f7b1","year":2024},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.894242Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:bb5d1447b225322498dee5abe6ac008789213f6fba4530ed2a24b0018cc36d3b","observation_id":"d539e582-2bee-4d2d-8936-320823f2d455","resolution":{"observed_at":"2026-08-07T12:44:04.701564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.538595Z","title":null,"venue":null,"work_id":"530cd589-0c00-4ebd-9bf8-9909110c1d82","year":2024},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.963389Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:fdbf5117ca7c3ca5664f554ee4c8e37c7c6d3e40403e9e0cc8b8ea3037795ece","observation_id":"2909f1e1-31bc-4a3a-a54c-c184117a9a4d","resolution":{"observed_at":"2026-08-07T12:44:04.597578Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.341812Z","title":"Non-isotropy regularization for proxy-based deep metric learning","venue":null,"work_id":"cdf0ec17-0cc4-4cb7-94dd-7176d4dd703e","year":2022},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.037731Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:c66950211c4d8d3991cc37116a7d7e367d3b1a807b20cb7514d23069cd4c6662","observation_id":"13199643-c972-4b8b-b7db-812a8a4feeae","resolution":{"observed_at":"2026-08-07T12:44:04.442806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.233075Z","title":"Neighbourhood component analysis","venue":null,"work_id":"8466c531-6983-43f9-9904-cd09bbd86e2b","year":2004},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.117052Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:2c628157d6496121470077113d7a9be2fc4146f1463df0f20f5b4edb895fec8e","observation_id":"1a197767-ac52-4906-8c01-364866ecb7a9","resolution":{"observed_at":"2026-08-07T12:44:04.262626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.141639Z","title":"Revisiting unreasonable effectiveness of data in deep learning era","venue":null,"work_id":"8be10997-ea7f-4308-a8f1-278870ba1886","year":2017},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.207924Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:646d44d9c20b8ca06cde31c1f2f9ee4c0acc375d8cd23de411ced17756d33860","observation_id":"6bf84f99-8294-4cf8-9a3a-e0987fb56e56","resolution":{"observed_at":"2026-08-07T12:44:04.181635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.032793Z","title":"Prox- ynca++: Revisiting and revitalizing proxy neighborhood com- ponent analysis","venue":null,"work_id":"75e39201-53ea-4311-9b1c-db55fa94f201","year":2020},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.270734Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:bc184cf7730a65b543e97d9de9b06e03ed1d5667eb606a3744b3257117a24e99","observation_id":"f13ad1b3-d11b-412a-bfa7-563e41e65a92","resolution":{"observed_at":"2026-08-07T12:44:04.068765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:43:58.348098Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.348098Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:66c22635b92c15b79053964bf56cd3fa0329740fba5d73651d42a451234e203c","observation_id":"795cae06-0ac5-4079-b8e7-ccce4b753b23","resolution":{"observed_at":"2026-08-07T12:43:58.348098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.888819Z","title":"Convolu- tional visual prompt for robust visual perception","venue":null,"work_id":"1fcbe890-a6f1-49ce-b3bc-4ed3910ff836","year":2024},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.401879Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:fba90f1019c73ab2a3cd446255f338cabd376ab9aef35351361c4a564c016a8b","observation_id":"064a62a5-787a-4eb2-8d9c-ab8b2528391e","resolution":{"observed_at":"2026-08-07T12:44:03.975586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.685723Z","title":"Visual query tuning: Towards effective usage of intermediate representa- tions for parameter and memory efficient transfer learning","venue":null,"work_id":"3b56936d-438f-4fe6-bdca-77a33a4cde58","year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.420135Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:ce66ac18296ef0f45686354df291da6c79ce2d912300a8971ead675876fe1986","observation_id":"6aeaedea-3b1b-4696-85e2-880a042e876e","resolution":{"observed_at":"2026-08-07T12:44:03.765035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.496630Z","title":"Building a bird recognition app and large scale dataset with citizen scientists: The fine print in fine-grained dataset collection","venue":null,"work_id":"25ff0e59-2724-48c8-958f-4ea60a46b565","year":2015},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.445079Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:df742d7382def074f84f0d35ec4f0ad3c4b9ddfa1eeeadc645d812601c55b022","observation_id":"edd13ea8-5f36-4ad2-a6ef-83228107f8d0","resolution":{"observed_at":"2026-08-07T12:44:03.586310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:58.533969Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.533969Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:997630af377916a9f740a82b6a72adbeb9be09a1ba901d10128a807a407a8826","observation_id":"bb474718-aeb9-41ef-b302-66ee56ae6d30","resolution":{"observed_at":"2026-08-07T12:43:58.533969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.353558Z","title":"Attention is all you need","venue":null,"work_id":"996445df-d8a7-4f7c-a837-658bcb85a95e","year":2017},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.617207Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:23317f8a64b5dd8dd983921a89ac985a967d0036fc015568b5e5ea206d6fdde7","observation_id":"e3e37212-54a7-4fa5-addf-7776594f692b","resolution":{"observed_at":"2026-08-07T12:44:03.403516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.235653Z","title":"Rotation equivariant cnns for digital pathology","venue":null,"work_id":"6d56037d-3d8d-4986-afb0-c70ec0affa34","year":2018},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.661155Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:9c3f9d8ff86a69e7169ff4e557a097634c2cdfbdb575978df8348d08e52bbb85","observation_id":"e6c03e8a-3381-46c3-84c1-da10df9ed95b","resolution":{"observed_at":"2026-08-07T12:44:03.286024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:02.995746Z","title":"It takes two to tango: Mixup for deep metric learning","venue":null,"work_id":"363a4e99-a4d7-4f28-b871-2ed984c4f467","year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.742058Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:3894cd499f63a1509e49f9c187581dfb602936c50bf54d2571f05c7cbce3658e","observation_id":"fe4f1499-1119-41f5-81b6-dbfaf48214b9","resolution":{"observed_at":"2026-08-07T12:44:03.114534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:58.794340Z","title":"The caltech-ucsd birds-200-2011 dataset","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.794340Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:5c70add62972f101fae4e23779cb5f0fb8a041a03eb84d1d51418356f653a236","observation_id":"71989702-ac17-4644-9177-28b6f42d1399","resolution":{"observed_at":"2026-08-07T12:43:58.794340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:02.815088Z","title":"Adversarial cross-modal retrieval","venue":null,"work_id":"95221236-b04d-4d80-80fc-7ead35b6001c","year":2017},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.829691Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:4ca09f2b0284286464b7ebc3748b4247062ca388a5b66d7096be7b375f305958","observation_id":"2802b62e-4073-477b-846c-863a19d2b1bd","resolution":{"observed_at":"2026-08-07T12:44:02.910397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:02.594539Z","title":"Adapting shortcut with normalizing flow: An efficient tuning framework for visual recognition","venue":null,"work_id":"149b25d7-4170-4783-a056-ddef65ca1776","year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.859656Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:61fb139f19c3720108d27e92b58e2fab9eda3d14934e89fe87bc6ae69d8aa8b6","observation_id":"121ecaa6-8624-466e-852c-2fe27aff9edb","resolution":{"observed_at":"2026-08-07T12:44:02.688257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02382","last_updated":"2024-05-27T06:51:07Z","snapshot_observed_at":"2026-07-06T17:25:01.583656Z","submitted_at":"2024-02-04T07:49:02Z","title":"Revisiting the Power of Prompt for Visual Tuning","version":3},"cited_work":{"arxiv_id":"2402.02382","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.02382","snapshot_observed_at":"2026-08-07T12:43:59.765810Z","title":"Revisiting the Power of Prompt for Visual Tuning","venue":"cs.CV","work_id":"5974c883-76f8-4087-93ac-cda3d48d6e44","year":2024},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.898286Z"},"links":{"cited_paper":"/paper/2402.02382","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:03aeb6c56214221a55aeb2775d5521c6ca25db62e8cc25cef235debb69be774e","observation_id":"d58333dd-d6d5-4f9e-962f-b6572ea21bae","resolution":{"observed_at":"2026-08-07T12:43:59.898846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:02.359819Z","title":"Sun database: Large-scale scene recog- nition from abbey to zoo","venue":null,"work_id":"53190057-df3b-4a97-8032-a94bda463613","year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.932692Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:4037b8df9bdd9e96b7a452247d79f22f9818a8af517e4ed52a7511393ade7da9","observation_id":"4ef1c72f-3318-4e12-a6fc-a05406ccc4e6","resolution":{"observed_at":"2026-08-07T12:44:02.473664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:02.108854Z","title":"Difffit: Unlocking transferability of large diffusion models via simple parameter- efficient fine-tuning","venue":null,"work_id":"d3617196-8775-4863-9294-94c9ee976e58","year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.968391Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:1780ee21e9354d1ca802c1d9fafde348f03b18ad8553a05c0003eebf9ccf4eba","observation_id":"3d4a4cb1-c67b-4e3e-9a61-19ada5a00833","resolution":{"observed_at":"2026-08-07T12:44:02.209062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:01.879745Z","title":"Improving visual prompt tuning for self- supervised vision transformers","venue":null,"work_id":"53ea8484-a3df-4529-915e-51c1266fb05a","year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:59.010365Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:4af893f86df76d50799f6d5249e8e0084c59c3e4a66ee2e780d3759e6fbaae67","observation_id":"217538ae-4c07-4814-821b-e1266942bfaf","resolution":{"observed_at":"2026-08-07T12:44:01.993968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:59.077581Z","title":"Bitfit: Simple parameter-efficient fine-tuning for transformer-based masked language-models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:59.077581Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:730eb984ea7cdce29407f6443cc9c80f98f876d48e64a4e107f57c02a19e341c","observation_id":"a8fa3316-c4d5-4be6-9af2-ce089c30e13f","resolution":{"observed_at":"2026-08-07T12:43:59.077581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04867","last_updated":"2020-02-21T13:36:15Z","snapshot_observed_at":"2026-08-09T06:48:42.729935Z","submitted_at":"2019-10-01T17:06:29Z","title":"A Large-scale Study of Representation Learning with the Visual Task Adaptation Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.04867","snapshot_observed_at":"2026-08-07T12:43:59.110572Z","title":"A large-scale study of representation learning with the visual task adaptation benchmark","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:59.110572Z"},"links":{"cited_paper":"/paper/1910.04867","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:fe41d946221d8c3e5e286189b2cf6a99a83c93b8bea36c1ead8bff440f719b93","observation_id":"f94d2271-bb75-477f-9bd4-bd2af16650cf","resolution":{"observed_at":"2026-08-07T12:43:59.110572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02923","last_updated":"2024-03-23T07:00:15Z","snapshot_observed_at":"2026-07-06T16:57:17.747414Z","submitted_at":"2023-12-05T17:50:55Z","title":"MoSA: Mixture of Sparse Adapters for Visual Efficient Tuning","version":2},"cited_work":{"arxiv_id":"2312.02923","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.02923","snapshot_observed_at":"2026-08-07T12:43:59.414609Z","title":"MoSA: Mixture of Sparse Adapters for Visual Efficient Tuning","venue":"cs.CV","work_id":"a0fa3b12-bce5-4d9e-a078-c0bd43b1cd45","year":2023},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:59.143965Z"},"links":{"cited_paper":"/paper/2312.02923","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:7c13948827bc63cfc88086461b63a9dc7af09195285a39f526dbd8b5af872920","observation_id":"ad13b19e-d4e7-4cbf-94b6-779e0353a143","resolution":{"observed_at":"2026-08-07T12:43:59.489971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04673","last_updated":"2022-06-14T12:15:55Z","snapshot_observed_at":"2026-08-09T04:45:05.706921Z","submitted_at":"2022-06-09T17:59:58Z","title":"Neural Prompt Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04673","snapshot_observed_at":"2026-08-07T12:43:59.183930Z","title":"Neural prompt search","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:59.183930Z"},"links":{"cited_paper":"/paper/2206.04673","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:407b144483d59345f354b247ccc17a6a2f9bf615487e898a583227ad7e034a52","observation_id":"59f6711e-d790-4f7b-83bd-f9871dddc24c","resolution":{"observed_at":"2026-08-07T12:43:59.183930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:01.615941Z","title":"Rethinking semantic segmentation from a sequence-to-sequence perspective with transformers","venue":null,"work_id":"08ddad76-3c35-4f10-ad0c-dded8655a195","year":2021},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:59.219335Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:f0896883686b1bab92507488d57e3f19f64aeb51bc46cac4b1edfdd6dc4539e5","observation_id":"94d388f2-9bd8-437c-905e-fb0747c06713","resolution":{"observed_at":"2026-08-07T12:44:01.747707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:01.415094Z","title":"Semantic understand- ing of scenes through the ade20k dataset","venue":null,"work_id":"01db1984-955e-43c0-b2bf-965969cc92a1","year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:59.264040Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:f1f375fa1617d7e769e0cef0c88690de6e2de0de7fb4b4e7f7dc6ac8351fcbbd","observation_id":"811e8f89-4a3e-4436-92f7-2f1f736aeee5","resolution":{"observed_at":"2026-08-07T12:44:01.507329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:00.433523Z","title":"Following established proto- cols [19, 33, 45], we report mean accuracy across three runs with different random seeds","venue":null,"work_id":"1c230fe8-3433-478b-b720-348cfcf517e7","year":null},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:59.305859Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:9d213974bc08a8ce5eea3a0bf4a507e34e252bd15756cbef7b440cc0c987fbb2","observation_id":"2c3afc00-9444-4efb-b502-3968220f89c6","resolution":{"observed_at":"2026-08-07T12:44:00.987071Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:01.321966Z","title":"Details About the Experiments A.1","venue":null,"work_id":"5a578948-a43d-475c-85ab-ec5710359321","year":2011},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:59.285066Z"},"links":{"citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:62c575a31fcf0872201335d32bd76d2d6e2d50dbfc313e6b3c291f8efddb9a69","observation_id":"9c340b43-ab4b-4411-8eef-674f2ebf55a1","resolution":{"observed_at":"2026-08-07T12:44:01.361118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T04:46:12.175900Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers"},"reference_resolution":{"displayed":93,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":2,"verified_fuzzy":54},"total_outbound_references":93},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 93 of 93 outbound references and 0 inbound Pith citation observations for arXiv:2505.23694."}