{"as_of":"2026-08-14T21:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1e22def544b2e14b01d39fff1a19ce59dcff112fb21f8d08cee52bbd88c55b0c","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:37:30.225257Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T00:32:35.119143Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:29:57.636038Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2506.23856","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23856","snapshot_observed_at":"2026-07-04T16:29:57.636038Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models,","venue":null,"work_id":"e53e7851-75de-4186-a856-846dbd2570c8","year":2025},"citing_paper":{"arxiv_id":"2606.24248","last_updated":"2026-06-23T07:35:49Z","snapshot_observed_at":"2026-08-03T00:41:42.999699Z","submitted_at":"2026-06-23T07:35:49Z","title":"M^2C-EvDet: Multi-Domain Multi-Order Cross-Modal Knowledge Distillation for Event-based Object Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T00:32:35.119143Z"},"links":{"cited_paper":"/paper/2506.23856","citing_paper":"/paper/2606.24248"},"observation_digest":"sha256:3d25598684a4ec646352823333311d4834e6490fb93527d95aa700681b130e5d","observation_id":"a9dd6569-f00e-439d-a9a9-0f6aff9a755a","resolution":{"observed_at":"2026-07-04T16:29:57.637515Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23856/citation-record","integrity":"/paper/2506.23856/integrity","json":"/paper/2506.23856/citation-record.json","paper":"/paper/2506.23856"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.362652Z","title":"Dept: Decoupled prompt tuning","venue":null,"work_id":"8b7e57ea-eba7-4a51-9751-6234d48f6913","year":2024},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.931500Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:2eaff9a2cef3ebe8b8876a0071a1400135980a8cfc06c263ad3d71c5ee667f17","observation_id":"42a143cf-56cf-44eb-9e66-373d11fc3027","resolution":{"observed_at":"2026-08-06T21:37:31.367045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.347931Z","title":"Learning trans- ferable visual models from natural language supervision","venue":null,"work_id":"e27f9a70-6e98-44c6-a7dd-5aa7b028bd58","year":2021},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.936191Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:8c702d43b78a31272b9a8a340345ca1f79dae99737558d9802747e72d4ff4929","observation_id":"10c8f469-62c6-48aa-b788-e2d006debfc9","resolution":{"observed_at":"2026-08-06T21:37:31.352496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.331263Z","title":"A closer look at few-shot classification again","venue":null,"work_id":"81ddbc1f-d4e8-4e02-a551-3a44af9c7b39","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.940883Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:455816ab3bdd2df8357ceaea54bd8079287db36606dd60a8837443a805a0162c","observation_id":"e88ac3bc-595d-44ca-a87d-cb3cfa98fab0","resolution":{"observed_at":"2026-08-06T21:37:31.336067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.316093Z","title":"Bayesian prompt learning for image- language model generalization","venue":null,"work_id":"12e8705c-f69b-40de-9ffc-dee57b12cad3","year":null},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.945572Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:676ad959e29fdf8ec9ab7c6a5f94027cf8b376f3a0a5c0ddb8408a4569509d9b","observation_id":"ee9246f5-154e-415d-bccf-3430d116f005","resolution":{"observed_at":"2026-08-06T21:37:31.320946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.299770Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":"549c9b63-15ca-471b-b479-707131dfb82b","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.949965Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:a48389af6b4a03e00e083b6bb58f63998954a750e8d3463782d762015bb4a125","observation_id":"1bf7febd-f5f0-42b3-86db-42c1ae529c13","resolution":{"observed_at":"2026-08-06T21:37:31.304116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.284010Z","title":"Conditional prompt learning for vision-language models","venue":null,"work_id":"157f5ef2-1e60-4268-b5fd-d72dd1ed3c05","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.954150Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:38888721c0710dfab480ae63b4b4c054ccfe4c13255e0d78099f2f4550b7f548","observation_id":"36ef0ed2-b19e-4c7b-89fb-e0c761633f5a","resolution":{"observed_at":"2026-08-06T21:37:31.289366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.254210Z","title":"Visual-language prompt tuning with knowledge-guided con- text optimization","venue":null,"work_id":"ca2add24-9387-4567-8262-d2bb750c00f2","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.963320Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:a26c59e3451f4b0119a7d9a4482931362beec23a8b0f4bd71f914337969c319b","observation_id":"51dcf074-8db9-47ef-baee-2a403d94a32a","resolution":{"observed_at":"2026-08-06T21:37:31.258623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.239202Z","title":"Prompt-aligned gradient for prompt tuning","venue":null,"work_id":"8fc56659-3a56-44d8-885b-3ad2f6f79f61","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.967622Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:f76f0ba047c41a85fc527e9bd53c8f1e81c324457b2b21115366ac91bafe344a","observation_id":"078bdf5b-3200-48c4-af67-2de18b03526b","resolution":{"observed_at":"2026-08-06T21:37:31.243884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.223045Z","title":"Distribution-aware prompt tuning for vision-language models","venue":null,"work_id":"717b9fde-6382-4825-9385-449102c487c9","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.971651Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:b524ac7ae3cfa8a1edb30be06997ecb8f59fd0d0296724354cdd10214d5fa851","observation_id":"d558fa0b-5c62-48de-8d20-a3bf83cfcfde","resolution":{"observed_at":"2026-08-06T21:37:31.228317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.206747Z","title":"Context-aware Alignment and Mutual Mask- ing for 3D-Language Pre-training","venue":null,"work_id":"62ca0e94-8b48-43fe-bf96-c3b7613123c0","year":null},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.975996Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:34a7f29e09d8b16b08f07f77a631126123984d094779847d06e1a6311f5608a3","observation_id":"bc2cdb00-bc92-494b-98bf-7e3c56bc0edc","resolution":{"observed_at":"2026-08-06T21:37:31.211644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.189853Z","title":"Recent advances in natural language processing via large pre- trained language models: A survey","venue":null,"work_id":"8b8227c0-3f91-4975-89c6-9e208b12c58b","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.980348Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:b04edba6cb145e31ab4dcd80c551288496b547d0b14ed56b9194644e689b7422","observation_id":"02749759-2fa5-4cd4-af91-d8f9b3fc15ba","resolution":{"observed_at":"2026-08-06T21:37:31.194747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.171502Z","title":"Nat- ural language processing: State of the art, current trends and challenges","venue":null,"work_id":"6b8a18ce-3695-4c6b-9894-8d9d39cbb592","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.984647Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:07423698cdd76247ae1603753487b427aa584fc2c49eada77ac93280c17a0840","observation_id":"331cfc70-9bf6-4f40-b869-43c69c894a17","resolution":{"observed_at":"2026-08-06T21:37:31.176710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.156691Z","title":"Vilt: Vision-and- language transformer without convolution or region supervision","venue":null,"work_id":"34b5b7eb-fe5e-42de-bbaf-57f5041ee199","year":2021},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.988859Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:fedecc6f8b33461af6630d6b80938514d8fa77f123754db3e0cdf4ccb0393fc6","observation_id":"db735bfb-72d4-4aba-9778-9b0b3d7c90b9","resolution":{"observed_at":"2026-08-06T21:37:31.161326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.142632Z","title":"Scaling up visual and vision- language representation learning with noisy text supervision","venue":null,"work_id":"4c6747f6-b4c5-4d16-94ef-4a10dd3f48e7","year":2021},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.993396Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:6f692843fc637de9ba02214ac72af89641a3faab30173bb16af7233c1be2aa45","observation_id":"a8938f1c-a23c-4734-b879-22de8c45f1a0","resolution":{"observed_at":"2026-08-06T21:37:31.147022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.128079Z","title":"WenLan: Bridging vision and language by large-scale multi-modal pre- training","venue":null,"work_id":"4b85494e-0496-4391-b420-f176dbeb8b9d","year":2021},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:29.997872Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:18515939556dac303145e60582498c4b5f3c9851d2f559e950583f517ad0456f","observation_id":"b5d0aceb-a5b8-4986-9948-5b846aa4f352","resolution":{"observed_at":"2026-08-06T21:37:31.132706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.112786Z","title":"Align before fuse: Vision and language representation learn- ing with momentum distillation","venue":null,"work_id":"b7085724-02ed-4c61-a3c5-979dc6079e1e","year":2021},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.002407Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:84625493c944d9cb558b8cc650cce6b84da7420f96353418991dd16c2d215211","observation_id":"93208d3e-066f-41ca-bb24-9498c922d608","resolution":{"observed_at":"2026-08-06T21:37:31.118090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.098229Z","title":"Disentangled Multiplex Graph Represen- tation Learning","venue":null,"work_id":"e7bac521-d9c9-4b2e-95ee-bc6bba26be5f","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.007257Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:13827b0361d8a7a49cdff00c23ce84c6ab40b9d7a3ebb9e3a979ea2e6941a4ed","observation_id":"e669899b-a506-4ba9-b199-cada8ba773c7","resolution":{"observed_at":"2026-08-06T21:37:31.102803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.083389Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic rep- resentations for vision-and-language tasks","venue":null,"work_id":"c4d05fdb-542e-451b-b79f-2012f72fd77f","year":2019},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.011553Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:fa23dfe15b121fd755d59c50b1c45d9232e3a1ce9c550a6709cf266823fee382","observation_id":"443e8130-b339-4d0e-a49b-96c56f8ffb51","resolution":{"observed_at":"2026-08-06T21:37:31.087941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.068938Z","title":"X-clip: End-to-end multi-grained contrastive learning for video-text retrieval","venue":null,"work_id":"042f6edb-113d-458c-9d87-4ad6d9b561f0","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.015886Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:af18ddf3b2b5d1e34399c342490690fd59199ba79ba3dde3cb9f0cb8e49a65ba","observation_id":"cb02161e-0026-44d3-953b-af180183361d","resolution":{"observed_at":"2026-08-06T21:37:31.073453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.053496Z","title":"Complementarity-aware space learning for video-text retrieval","venue":null,"work_id":"a2de21ff-b8bf-4b6a-b138-64d774870034","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.020212Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:9f662988db8035db05a4a2404d319d41397752a7cbdfb872bd56e60a3c42ecf0","observation_id":"8f69235b-9b31-48ea-967e-4e982dd4542d","resolution":{"observed_at":"2026-08-06T21:37:31.058055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.038832Z","title":"Denseclip: Language- guided dense prediction with context-aware prompting","venue":null,"work_id":"80a22336-ee91-4955-84bc-98df20100a7f","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.024848Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:19254df4953348de65b710bf5b128cb119135d241a761a86ddfbf188150e2082","observation_id":"b1b0de1f-ac36-4a21-9a62-6a395843b727","resolution":{"observed_at":"2026-08-06T21:37:31.043497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.023345Z","title":"Extract free dense labels from clip","venue":null,"work_id":"7f635bdd-1417-4d50-9459-de11aa9f6f64","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.029020Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:ad8bca0ab656e0c851c9ee082c54c4b6653b37c57e84b5f4e3bc4edaaa1e8a5c","observation_id":"8f864528-e0aa-4af5-8cb6-e74c775337d3","resolution":{"observed_at":"2026-08-06T21:37:31.028234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.009233Z","title":"Clip-nerf: Text-and-image driven manipula- tion of neural radiance fields","venue":null,"work_id":"6bf535a5-b250-4f8a-9d60-5f4386cdf2c5","year":null},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.033133Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:cf4a9f037080d88ca77768e91214a8db245d706bead88b54ee729a8062a6c59d","observation_id":"bed7ca1b-cf45-4380-9772-cc5b841bc717","resolution":{"observed_at":"2026-08-06T21:37:31.013589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.992911Z","title":"Styleclip: Text-driven manipulation of stylegan imagery","venue":null,"work_id":"5d07e89b-3c90-42a9-9da0-6067823d53ce","year":null},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.037572Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:aa3798b69cc92572025073748e850253879a6541b3084c3b8533d2a0440aa5a9","observation_id":"a4cb55e4-90d6-4568-b21f-eb9ee2d7d48e","resolution":{"observed_at":"2026-08-06T21:37:30.998539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.978520Z","title":"Parameter-efficient transfer learning for NLP","venue":null,"work_id":"7e3cbb1e-9843-463e-b06f-936cfbd77698","year":2019},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.042063Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:6fb3031ad7b4e6492e0b08a8a470f041392ce5c08a6656f70d3e2d2cac30802a","observation_id":"705724cd-72a8-49c2-b018-56e5ca3ffd8a","resolution":{"observed_at":"2026-08-06T21:37:30.982886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.963342Z","title":"Learning a universal tem- plate for few-shot dataset generalization","venue":null,"work_id":"54b6f8f2-ac36-4d7d-a546-9955b353d0ad","year":2021},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.046681Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:f861a878c75433f241041166391e316d6de8971f03cbe1ea0a81ffba7b25e640","observation_id":"d5674e47-e6c9-4c04-942d-a74b5670c08c","resolution":{"observed_at":"2026-08-06T21:37:30.968078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.948812Z","title":"Reliable Few-shot Learning under Dual Noises","venue":null,"work_id":"f9627c8e-ae70-4495-9308-28325539c63e","year":2025},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.052009Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:de5719f894d0a058f170bbf3019acfb21820bff3d7b72e8eff537f52d3984bea","observation_id":"480c1647-b762-425d-a5cf-994d7e30d472","resolution":{"observed_at":"2026-08-06T21:37:30.953004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.934742Z","title":"Prefix-Tuning: Optimiz- ing Continuous Prompts for Generation","venue":null,"work_id":"391dc1b8-292b-4b9b-a229-0419829cdeaa","year":2021},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.056349Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:799f308450e7dc61896b79a7225a16fa1abd3e78b93fad2691ba0c7c44e9ba8b","observation_id":"ee68335c-474d-41d7-b3c2-006ad3b17063","resolution":{"observed_at":"2026-08-06T21:37:30.939262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.919619Z","title":"Skip Tuning: Pre-trained Vision- Language Models are Effective and Efficient Adapters Themselves","venue":null,"work_id":"a25c3d6c-bfc3-4db6-9487-7c7111356f64","year":2025},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.060822Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:995276b9aaa93bc5d2152a61ac9b1f6ca18ba3b2c5f71b0455986d2b34789944","observation_id":"f1598afd-3a49-40a5-9ed7-b39261f22984","resolution":{"observed_at":"2026-08-06T21:37:30.924802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.905086Z","title":"Lora: Low-rank adapta- tion of large language models","venue":null,"work_id":"66d715c9-d44b-41b2-a74b-faf356ce4aef","year":2021},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.065096Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:fec686b6925dab701e5991c5640877ccbc6e07a78bb529fc9b9a0d538ac5d72b","observation_id":"60f427b5-a497-4c2f-bcab-f211532013d6","resolution":{"observed_at":"2026-08-06T21:37:30.909348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.891194Z","title":"Learning to decompose visual features with latent textual prompts","venue":null,"work_id":"1efe8ab1-05c1-45c6-8ee0-7961fdd77f4c","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.069160Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:454eefe6e13baee894ab556a34d90d11c5a964687ceeee27afbb0ad493342363","observation_id":"e8ce2f53-e69d-4b28-b94d-4f21f944307d","resolution":{"observed_at":"2026-08-06T21:37:30.895517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.875870Z","title":"Prompt learning with optimal transport for vision-language models","venue":null,"work_id":"e07ede23-fe95-428c-866c-f3994e8384f3","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.073564Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:bd7efa029cd08a773ef6e7f64eb931d30e9d9115c07221446f0e1fe422aee2d2","observation_id":"4478a318-60e6-48e8-b33f-3fae6c334823","resolution":{"observed_at":"2026-08-06T21:37:30.881264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.860676Z","title":"Consistent Prompt Tuning for Generalized Category Discovery","venue":null,"work_id":"35a39ebc-66dd-4bcf-9f1c-f18d227e9821","year":2025},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.077671Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:0d3c838a3a3ca8f697d1a74bef016e7c4d06574d444ed0b80dda6785fcd98de1","observation_id":"af539285-740e-42f7-b81f-4020ddae8e05","resolution":{"observed_at":"2026-08-06T21:37:30.865519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.846472Z","title":"Progressive visual prompt learn- ing with contrastive feature re-formation","venue":null,"work_id":"574e117b-5a50-42da-bb58-5332d56f728f","year":2025},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.081839Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:a3c9f96962c55daad33acbc7609f6fc089ee46deab60adc2604e24b3cd11f16c","observation_id":"0f1fca09-a50e-4fac-94c8-cd61ccb67226","resolution":{"observed_at":"2026-08-06T21:37:30.850748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.831681Z","title":"HybridPrompt: Domain-Aware Prompting for Cross-Domain Few-Shot Learning","venue":null,"work_id":"b2602b8e-ced2-4b55-9375-e823ce6622ce","year":2024},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.086447Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:8b5aea09c4a364b8ad816da938cae0953e21deec42c36095e4e4217d0e3f0945","observation_id":"bd326d7c-1da3-498a-bd16-a395faa968e7","resolution":{"observed_at":"2026-08-06T21:37:30.836301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.816504Z","title":"DETA: Denoised Task Adaptation for Few- Shot Learning","venue":null,"work_id":"0bb30784-2ee8-4f79-89b9-c8a73177aa66","year":2024},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.090759Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:1531eb49c1774641216bae2ad5a5ba34cbe86a94c3185a799ab8ac7ddbcd68c2","observation_id":"f3770958-619b-4d86-9596-660fe212a0f4","resolution":{"observed_at":"2026-08-06T21:37:30.821226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.801743Z","title":"Meta-fdmixup: Cross- domain few-shot learning guided by labeled target data","venue":null,"work_id":"a24a819d-f06b-497e-8fdc-bd74b9bb80c3","year":2021},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.094863Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:b53bcb40f61be0a24b50c428ed730debc9f48f58f0b70a7f21acf4308ba60599","observation_id":"f5c2de13-800a-4f7c-95ba-73f8579489c8","resolution":{"observed_at":"2026-08-06T21:37:30.806719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.786441Z","title":"StyleAdv: Meta Style Adversarial Training for Cross- Domain Few-Shot Learning","venue":null,"work_id":"7fb62ebb-a5eb-4c89-abec-6bbf1376645e","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.099718Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:3e41a218ec124f6b7b78a8d3c2b8b539293afb658b2293f69815de6fe39918bf","observation_id":"5f6c5ee2-111f-43c9-afdb-6bb457702b20","resolution":{"observed_at":"2026-08-06T21:37:30.791554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.771186Z","title":"Tip-adapter: Training-free adaption of clip for few-shot classification","venue":null,"work_id":"0d6e57fa-b6f8-4490-afe4-4ba6c87fa7dc","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.104180Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:1d5c242222a068e5d4157bfddec1dc8e4ab09413be4ae04fb60fd9504d80702c","observation_id":"1c6bea8b-0247-452b-b50d-04995c25ba88","resolution":{"observed_at":"2026-08-06T21:37:30.775458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.756767Z","title":"Prompt, generate, then cache: Cascade of foundation models makes strong few-shot learners","venue":null,"work_id":"9b2f20c9-df39-4853-a663-1926cd0b7ca4","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.108730Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:cf9d1e6eda9735a75413bfda9c08e978a55d1df41a3699986c5ebe2a53ebc61f","observation_id":"c63402ce-65f7-428e-88c5-d2c1a37ad210","resolution":{"observed_at":"2026-08-06T21:37:30.761137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.741920Z","title":"Visual prompt tuning","venue":null,"work_id":"e44588d0-659d-43e9-8f9c-eaa00d26ff7a","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.112906Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:cbb29ccce2afd8e440c796ebc966a57baaa1a1ac0002f6e0765102f3edd8f2a8","observation_id":"c5ce0667-06f8-4374-8ad7-d835396504fa","resolution":{"observed_at":"2026-08-06T21:37:30.745982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.727583Z","title":"Diversity-Aware Meta Visual Prompting","venue":null,"work_id":"a49ac064-1ec3-4381-bbbd-e4c908e6dd79","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.117304Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:edd9492df3f493ddfc197c71b40d3d4ef81772d2a1c1ad50e2a7316ade8c5568","observation_id":"4a4e4f27-5f3a-44b5-99cc-26804a2d49d9","resolution":{"observed_at":"2026-08-06T21:37:30.732034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.710936Z","title":"Self-regulating Prompts: Foundational Model Adaptation without For- getting","venue":null,"work_id":"5821dc06-0c6b-4330-a82b-15bfd337cd33","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.122007Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:e89bb0db11b2aad4e1fec631c95146934ebd2812b8acb01c2226b62949b2780f","observation_id":"79a15588-09d9-4db5-b08e-f4e22987960e","resolution":{"observed_at":"2026-08-06T21:37:30.716086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:31.269121Z","title":"Learn- ing to prompt for vision-language models","venue":null,"work_id":"1f1c08ab-60bb-4c78-b402-705b81e8f15d","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.126140Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:a2b2841a97c2eea3a0dd77a52bf01299b50f711b2738c834056850dd55a78425","observation_id":"abf237a6-6657-46ff-8161-eaa9f78ebafb","resolution":{"observed_at":"2026-08-06T21:37:31.273491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.694937Z","title":"FastText.zip: Compress- ing text classification models","venue":null,"work_id":"42e6a867-6a32-4299-8e43-9fca5872506c","year":2016},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.130492Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:fdcfbfc3badfeabd865f876a19dff8f0d913ca39cf6d996dcf563b6249dd1d0d","observation_id":"0fee4f5e-cf6d-415c-a3da-d8332fc03501","resolution":{"observed_at":"2026-08-06T21:37:30.699715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.679745Z","title":"Wikipedia2Vec: An Efficient Toolkit for Learning and Visual- izing the Embeddings of Words and Entities from Wikipedia","venue":null,"work_id":"c80f9608-6f48-4e00-aa10-67c3836f24be","year":2020},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.134583Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:c50111a862b5c78282992301e02b685df6973e50102daefe98cf0f8111e76ea8","observation_id":"350e753a-4400-484b-ac1a-5eb67e9b7f73","resolution":{"observed_at":"2026-08-06T21:37:30.684776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.664545Z","title":"Glove: Global vectors for word representation","venue":null,"work_id":"4546090a-5f9d-4ef0-8d70-ce8f05295422","year":2014},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.138582Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:d346c801f890fbd96978a7c27f6f5b7ea336e7c8e8adf6c73ab943ce37686429","observation_id":"c260c1fe-87de-4dca-9927-95eb05589038","resolution":{"observed_at":"2026-08-06T21:37:30.669294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.649089Z","title":"Clip-adapter: Bet- ter vision-language models with feature adapters","venue":null,"work_id":"12b5e582-1a69-4f48-8801-b98ba51ad6b5","year":2024},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.142734Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:83c89a3f6c9b041773d11c9da07b077746c9c5fe44795ecfd524f599a1b29261","observation_id":"57ce1808-9b63-465f-b022-496190804d30","resolution":{"observed_at":"2026-08-06T21:37:30.654120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.633573Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"d38d3475-d047-48c8-b565-d454ccb760de","year":2009},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.146701Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:33b435d1dd2aa2d601384a1b8296a6a3247ace3570ed1b80cc7ec157513fe6fd","observation_id":"6f27647e-a206-418b-8e45-9bf4f2bf7371","resolution":{"observed_at":"2026-08-06T21:37:30.638243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.618172Z","title":"Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories","venue":null,"work_id":"bde93e65-2af8-4e9f-8692-5dc63991fcd2","year":2004},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.151526Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:63c7c06a139d1e707e3e451a20567852a960168ab233ad53a544aa960594aaaa","observation_id":"1b176023-3367-4a47-8ab1-0c7f44b3df28","resolution":{"observed_at":"2026-08-06T21:37:30.623077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.603392Z","title":"Cats and dogs","venue":null,"work_id":"7267b5e8-11c1-458e-b65d-115469f91396","year":2012},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.156617Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:9335263beb726627bfb33c069cbb49ce0c4e5a6cdb1dd8b7709c0da615c4aef0","observation_id":"9a042d4f-8691-4172-b24d-3b4633719ce5","resolution":{"observed_at":"2026-08-06T21:37:30.608315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.589289Z","title":"3d object representations for fine-grained cate- gorization","venue":null,"work_id":"0fd695da-eb2c-46e3-9228-6737b218efab","year":2013},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.160814Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:9377c4fc48c34e3b3dfd40c41b50a2c677b77a479da5939d9733f6d24b3ec0c9","observation_id":"f7430805-a9f0-488d-8c1e-a8628d17988b","resolution":{"observed_at":"2026-08-06T21:37:30.593568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.574323Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":"6e87086b-fb3b-4980-8bf8-8fc4b23c028e","year":2008},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.164688Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:e790ce12f5018b7150c390130dc24deb1f087a4ee0b583a929e57ddfedc9fc81","observation_id":"02f2ed06-dc1d-4303-9342-39a78b69ddd3","resolution":{"observed_at":"2026-08-06T21:37:30.578974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.560979Z","title":"Food- 101–mining discriminative components with random forests","venue":null,"work_id":"d1e77bd8-9b81-496e-9d72-f4e2cec3d789","year":2014},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.168784Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:3437b792de82f2c9f4956052e244a2a82349972d1014daa45b3139b6583996f6","observation_id":"832a59e4-bc31-4c18-80db-fdf0f360847b","resolution":{"observed_at":"2026-08-06T21:37:30.565191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.546487Z","title":"Fine-grained visual classification of aircraft","venue":null,"work_id":"449a7f63-783a-4606-9b39-dc257cd90cce","year":2013},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.172939Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:fd495040a78dfcbbe362ca154729644bad58e9478fe9f5fee4e0d80da9cc2a60","observation_id":"015b16ee-8ea4-4553-b6ba-443c9a3e154b","resolution":{"observed_at":"2026-08-06T21:37:30.551062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.532475Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover clas- sification","venue":null,"work_id":"a47f5244-8e89-4247-b65e-a3129af5f415","year":2019},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.177505Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:98cd5cdaf0b767a9556002d6f8b2ecfedc4e0e533d612aea1a661ada974b9758","observation_id":"2d800825-dc08-47ca-a7ad-ff67b1ac93c0","resolution":{"observed_at":"2026-08-06T21:37:30.537081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.518050Z","title":"UCF101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":"7e0c44e4-568e-4484-8597-083c94b263dd","year":2012},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.181627Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:a6044ee4b7db601dd0cf43a261ac7df30f5d56304e3ab39fd72fb7f1aa6fd461","observation_id":"f6a0116f-583d-40f5-bfe6-51c21753d908","resolution":{"observed_at":"2026-08-06T21:37:30.522367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.503184Z","title":"Describing textures in the wild","venue":null,"work_id":"e49f33e3-e917-44b8-9165-8dd6a6e11451","year":2014},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.185820Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:2d198e8f7ac18a2444bd383f73fd616f609c59fc82f6a48c5947e0c0141e458e","observation_id":"4f69ec35-4baf-462d-bb9e-77979fcc612c","resolution":{"observed_at":"2026-08-06T21:37:30.507329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.488996Z","title":"Sun database: Large-scale scene recognition from abbey to zoo","venue":null,"work_id":"2d2ba389-44f6-4b97-902c-78dbeded909f","year":2010},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.190482Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:cc70e0cb8cb8c48861ac7c10b6faae4e0055aecc97a948db379e84124c57f45c","observation_id":"8cc07c26-2837-415e-a9fc-2cb61bfa1372","resolution":{"observed_at":"2026-08-06T21:37:30.493351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.473961Z","title":"Do imagenet classifiers generalize to ima- genet? In: ICML","venue":null,"work_id":"9f99d4fc-54c8-498a-8bce-9b717aa1bc7a","year":2019},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.194741Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:63f7375dbbb6958be0baac27d028f5a36e8691beb0a2238405b37576fe530f79","observation_id":"3c50391b-a103-4d08-95b0-bca52642ed36","resolution":{"observed_at":"2026-08-06T21:37:30.478310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.459703Z","title":"Learning robust global representations by penalizing local predictive power","venue":null,"work_id":"2553d123-ba2a-4b15-bdf1-13a7d8e7c181","year":2019},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.198893Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:762913cd1446621bb2e51aaf33182e8ffe274ce7be1ab491da397a48e4e22e2d","observation_id":"a86bfedb-ea4f-4ecd-adf1-076560e3ea95","resolution":{"observed_at":"2026-08-06T21:37:30.463982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.444299Z","title":"Generating natural adversarial examples with universal perturbations for text classifi- cation","venue":null,"work_id":"3ff9bd0c-0415-4bcc-86fe-83c90c456c99","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.203178Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:8962edfffeb35be5480378eb42760999ca6d27bd7ffec4322aadef4742e1c40f","observation_id":"d38aec91-3c1b-440e-a579-6897d1ddcc06","resolution":{"observed_at":"2026-08-06T21:37:30.449439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.429653Z","title":"The many faces of robustness: A critical analysis of out-of- distribution generalization","venue":null,"work_id":"e7c5aea6-efae-4d4c-a380-365749dd8109","year":2021},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.207338Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:0fe4da5b1a849bcf13615dc98166ec5d591e71c96fc034c8bf87d4f2c0a0cb51","observation_id":"50480c85-a5d9-43cb-bb90-4759a3a55d65","resolution":{"observed_at":"2026-08-06T21:37:30.434073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.415006Z","title":"Self-regulating prompts: Foundational model adaptation without for- getting","venue":null,"work_id":"2dcb6420-620a-4402-8da2-c17667ed8d23","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.211638Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:2043cfb77ce2932796141956d3c1689c39c88d27dcd4614bc0839322400bbe74","observation_id":"cc3ac732-1f26-4196-9457-1185694f221f","resolution":{"observed_at":"2026-08-06T21:37:30.419746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.398902Z","title":"Prompt distribution learning","venue":null,"work_id":"04e333e2-76ab-4541-8e60-8a4dcb33afc4","year":2022},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.215822Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:e727e69145137a3c57dc7d3703078f03f379801dcaedf62c3ed55e6621b2e0b5","observation_id":"d2dddb92-a4f7-4687-8abe-2f0122007eba","resolution":{"observed_at":"2026-08-06T21:37:30.403407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.383682Z","title":"Black box few-shot adaptation for vision- language models","venue":null,"work_id":"3db66fab-ac76-4c22-92f2-1b0365c1d0d0","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.220870Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:dabe9736072ce5370296bfb55aa3cb3713e985a8987882fd514cbec55c5ae5b9","observation_id":"12256246-c546-4514-bd14-aa92e610ee22","resolution":{"observed_at":"2026-08-06T21:37:30.388579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0050.6776","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:30.361755Z","title":"Read-only prompt optimization for vision- language few-shot learning","venue":null,"work_id":"46583d0a-abe8-4ecd-99e7-8bd281eb87b2","year":2023},"citing_paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:30.225257Z"},"links":{"citing_paper":"/paper/2506.23856"},"observation_digest":"sha256:3fdb73bc811052339113ab3f5267d9460a2965681d6c952fc636a1ae09dd5c8b","observation_id":"34bbdeb4-00de-4106-bb4a-63bd56f8f5e9","resolution":{"observed_at":"2026-08-06T21:37:30.372993Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23856","last_updated":"2025-06-30T13:51:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:27:47.661716Z","submitted_at":"2025-06-30T13:51:20Z","title":"A Closer Look at Conditional Prompt Tuning for Vision-Language Models"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":1,"verified_fuzzy":66},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 1 inbound Pith citation observation for arXiv:2506.23856."}