{"as_of":"2026-08-19T15:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c893cab649224de60b2ab4700abfbd58a87e0055e25eabff3c712f2d4b69806b","coverage":[{"denominator":297,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:20:46.460566Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:43:52.041500Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:39:30.504452Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18504","snapshot_observed_at":"2026-08-05T23:17:05.585412Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-14T09:10:14.609251Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:05.585412Z"},"links":{"cited_paper":"/paper/2506.18504","citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:b03a3c7ce58078ff6a81b94616ef658ab5668a3c79f48075cf39d87900baa0ae","observation_id":"f8531e7b-6bdf-4510-b747-0e5a4a7f87ed","resolution":{"observed_at":"2026-08-05T23:17:05.585412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18504","snapshot_observed_at":"2026-08-15T16:43:52.041500Z","title":"Generalizing Vision-Language Mod- els to Novel Domains: A Comprehensive Survey, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.041500Z"},"links":{"cited_paper":"/paper/2506.18504","citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:f38d66f7c1e4cac3136ff026e000ab5f1cfd0790e581c55164513b82155dc3aa","observation_id":"73a49552-63b5-4c00-9117-49fdd9df3423","resolution":{"observed_at":"2026-08-15T16:43:52.041500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"cited_work":{"arxiv_id":"2506.18504","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18504","snapshot_observed_at":"2026-07-04T03:39:30.504452Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","venue":null,"work_id":"e2acd742-18f2-4233-b988-2e641004a020","year":2025},"citing_paper":{"arxiv_id":"2605.04531","last_updated":"2026-05-06T06:17:41Z","snapshot_observed_at":"2026-08-11T11:35:56.335250Z","submitted_at":"2026-05-06T06:17:41Z","title":"Reward-Guided Semantic Evolution for Test-time Adaptive Object Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T17:12:52.435251Z"},"links":{"cited_paper":"/paper/2506.18504","citing_paper":"/paper/2605.04531"},"observation_digest":"sha256:7a8fcb42d0374ce97591306abd46fa1bafaa4c86f29d4027bf27778d56747c11","observation_id":"667b9e4e-2b25-4182-aeb4-cc5387b6a85d","resolution":{"observed_at":"2026-05-11T17:46:08.586135Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"cited_work":{"arxiv_id":"2506.18504","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18504","snapshot_observed_at":"2026-07-04T03:39:30.504452Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","venue":null,"work_id":"e2acd742-18f2-4233-b988-2e641004a020","year":2025},"citing_paper":{"arxiv_id":"2606.20913","last_updated":"2026-06-18T20:09:13Z","snapshot_observed_at":"2026-08-13T04:58:12.828049Z","submitted_at":"2026-06-18T20:09:13Z","title":"PROTON: Prototype-Based Test-Time Online OOD Detection for Medical VLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T17:46:19.654341Z"},"links":{"cited_paper":"/paper/2506.18504","citing_paper":"/paper/2606.20913"},"observation_digest":"sha256:8f1e947eb4a9bf01c7741c45a00954892726fb1d23084145776323fb7bcc4757","observation_id":"c3628922-9e24-426d-bf66-941106755559","resolution":{"observed_at":"2026-07-04T03:39:30.506681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.18504/citation-record","integrity":"/paper/2506.18504/integrity","json":"/paper/2506.18504/citation-record.json","paper":"/paper/2506.18504"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:37.784295Z","title":"Imagenet classi- fication with deep convolutional neural networks,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:37.784295Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:f3f71b0207cc656b7d1277f4a255da44e213adcaf75ceac1cad2a01bdfca76a3","observation_id":"d349e17f-f0d9-4bb0-bc33-eb9c1bf5e579","resolution":{"observed_at":"2026-08-06T23:20:37.784295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:37.866797Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:37.866797Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:038253702e7f8c20f38f53c3aa8144e20acfcb356d23364416559c593a40bca8","observation_id":"d3b0ba3d-e8ab-4040-a287-fe8a03f0855f","resolution":{"observed_at":"2026-08-06T23:20:37.866797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T23:20:37.948606Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:37.948606Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:1cba0c2f34cd9433abbcd7c1ae4453f352ca3a3515b8bf4470a71a4a4692ada6","observation_id":"ba61cf84-176d-4400-b4ab-8178fcdfea9f","resolution":{"observed_at":"2026-08-06T23:20:37.948606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:38.027773Z","title":"A comprehensive survey on transfer learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:38.027773Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:0a7b1763a5b1cdb5dfcd062320bd51c319d9112471fe2c83dd7098e9a69cfc0c","observation_id":"f12dea1e-5f6e-41a1-8860-1031f617dbcc","resolution":{"observed_at":"2026-08-06T23:20:38.027773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:38.098874Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:38.098874Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:695fcad9f99c32bbe14d888187951f83190fb994af4fa16bf973ae6b09b0d9a3","observation_id":"3876ab1a-2bd5-4771-b2bb-d36fcf9cced0","resolution":{"observed_at":"2026-08-06T23:20:38.098874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:38.187691Z","title":"Object detection in 20 years: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:38.187691Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:9c9199fcc8be50b351f8e5d6463b4809ee648c15b3336fdaeea4486247c0c446","observation_id":"7df030c7-3c80-4f2e-b197-abd21f08100d","resolution":{"observed_at":"2026-08-06T23:20:38.187691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:38.232103Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:38.232103Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:2b5438fac42418df47f1c7302f25595e572d219d5ab079403807414d73a738e8","observation_id":"aedf8c83-349a-4996-b862-63a63a9d321d","resolution":{"observed_at":"2026-08-06T23:20:38.232103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:38.333599Z","title":"Bert: Pre- training of deep bidirectional transformers for language under- standing,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:38.333599Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:5c20114847e8332b93fea778353eca9277db04452fc4f1d63d8a0c3be27a0502","observation_id":"dbcdc464-19e9-4d8a-9b0b-c18d010853ac","resolution":{"observed_at":"2026-08-06T23:20:38.333599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:38.423313Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:38.423313Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:5c8295f7faba76c789b015bb299b47121b6e546a57cf6b56eb58d1c2e286bbc8","observation_id":"212cadd8-83d5-4285-993f-db189bdf3e8a","resolution":{"observed_at":"2026-08-06T23:20:38.423313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:38.476430Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:38.476430Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:147610e58b730af8a75624337bd47de200cbec062ec5b3e35045458d4e94ccc1","observation_id":"51d4c471-ffd7-4635-8481-d73b59ae184f","resolution":{"observed_at":"2026-08-06T23:20:38.476430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:38.547295Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:38.547295Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:8495b2f503749af0b5ef5c9cf12fa3b4e3e5b73fdbe2b91c941281ac4d517af4","observation_id":"9d57ef23-3141-4a40-9bda-2563881c535c","resolution":{"observed_at":"2026-08-06T23:20:38.547295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:38.602830Z","title":"Regionclip: Region-based language- image pretraining,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:38.602830Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:95df6ebcbbe15e69efec20b9e1a074d4c35aaa8d7daf942d4d9c1b7a4ba78310","observation_id":"d597bd5f-77a3-4426-bd1d-deedc5fdbfab","resolution":{"observed_at":"2026-08-06T23:20:38.602830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:38.627552Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval and captioning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:38.627552Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:0b214456e84e8ed9e33b5faf1c7f89cc1065b6a9177034b836c2ed952b0532fb","observation_id":"a9a26ee2-9374-491a-a429-00b17ef22230","resolution":{"observed_at":"2026-08-06T23:20:38.627552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:38.712549Z","title":"Scaling up visual and vision- language representation learning with noisy text supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:38.712549Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:c7ccb3e043477e426edf2d4e8842a2b620b8a22cf3190d0936f034e1873b239a","observation_id":"8020ac47-9234-4198-bd06-f90e5ccff2f5","resolution":{"observed_at":"2026-08-06T23:20:38.712549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-13T15:12:42.567441Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-06T23:20:38.811989Z","title":"Coca: Contrastive captioners are image-text foundation models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:38.811989Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:12f027559c9b2e9abad309dc2c3eba8b30e1ba8d2cbc329acf44cb2f0d793f23","observation_id":"d4232269-f1d0-44d8-8efc-4807674bc538","resolution":{"observed_at":"2026-08-06T23:20:38.811989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:38.897611Z","title":"Blip: Bootstrapping language- image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:38.897611Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:ca8d074e5c173dbec91167a2f329d4ae3cd901e12365ce1cf3a12b7f666adee4","observation_id":"425e040d-e126-4d58-98a6-f8e8659f8d11","resolution":{"observed_at":"2026-08-06T23:20:38.897611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T23:20:38.976988Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:38.976988Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:ee343810ecc1c31553cbd4231f14279b73522549fcc2129a9e9f02d20a291daa","observation_id":"3d2264ba-a644-4b04-be28-b12959a837c8","resolution":{"observed_at":"2026-08-06T23:20:38.976988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:39.067243Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:39.067243Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:3be06dacf281bd6458859cad35e663a42b9c640edfa8af7f07cd474979498f49","observation_id":"437b529e-cbe6-4528-94fa-b0499530abcb","resolution":{"observed_at":"2026-08-06T23:20:39.067243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-19T06:18:29.748887Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-06T23:20:39.184735Z","title":"Pali: A jointly-scaled multilingual language-image model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:39.184735Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:8b4c694bd80bee103ae415edd657d00cb0b2350c36df8d4497a14ed877b85fed","observation_id":"f585e1b3-eaed-43b8-bdac-242b4234c635","resolution":{"observed_at":"2026-08-06T23:20:39.184735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-07T07:27:51.369423Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18565","snapshot_observed_at":"2026-08-06T23:20:39.384745Z","title":"Pali-x: On scaling up a multilingual vision and language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:39.384745Z"},"links":{"cited_paper":"/paper/2305.18565","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:75591c6abafbaf2cd48f0f26b3efc30577bcec6704653c99085d5775d7c4ef09","observation_id":"0a7f94c8-6ee1-423e-ba2f-ce2f7422eb18","resolution":{"observed_at":"2026-08-06T23:20:39.384745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:39.467253Z","title":"Multilingual diversity improves vision-language representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:39.467253Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:a07b6e1e53842eceee2ed83be4fa40870363ee14c8e816a1e8ff94e82eac8b83","observation_id":"9646b2fc-6620-41fc-94dd-1f971f9595ba","resolution":{"observed_at":"2026-08-06T23:20:39.467253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10054","last_updated":"2022-02-21T09:03:34Z","snapshot_observed_at":"2026-08-18T20:37:40.464812Z","submitted_at":"2022-02-21T09:03:34Z","title":"Fine-Tuning can Distort Pretrained Features and Underperform Out-of-Distribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10054","snapshot_observed_at":"2026-08-06T23:20:39.842240Z","title":"Fine- tuning can distort pretrained features and underperform out-of- distribution,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:39.842240Z"},"links":{"cited_paper":"/paper/2202.10054","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:567616097d0b4376a3e03f2c874dccfe1e33c054917536025dbfd91baee27319","observation_id":"927e81b3-a4d2-47eb-ab95-093607a773a1","resolution":{"observed_at":"2026-08-06T23:20:39.842240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:39.949305Z","title":"Clip-adapter: Better vision-language models with feature adapters,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:39.949305Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:660fd026eb205e0c69546b80a1f61c07f00591641863bc3c99ceb48e3c6dd26e","observation_id":"8675f38d-7e68-450e-915c-5758cad47977","resolution":{"observed_at":"2026-08-06T23:20:39.949305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:39.983804Z","title":"Tip-adapter: Training-free adaption of clip for few-shot classification,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:39.983804Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:13216a5bb18e58fc33c2b3bf89e52b46edd682d6e94692ed0bde7116220d4aa6","observation_id":"ac9fdebd-6e1b-430a-912d-b6a22e662725","resolution":{"observed_at":"2026-08-06T23:20:39.983804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-16T20:01:36.160048Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-06T23:20:40.073527Z","title":"The power of scale for parameter-efficient prompt tuning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:40.073527Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:6c8e85252c7242075b4858ecd913ad8e806cc4ee4380e1b78b601b208cd43cac","observation_id":"cc1deee2-edaa-44f6-abee-aa17980f440b","resolution":{"observed_at":"2026-08-06T23:20:40.073527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:40.147851Z","title":"Parameter- efficient transfer learning for nlp,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:40.147851Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:f7a3cbd84f86179e25751cc3c71242385bf0f1416e96e722104552f438cc1055","observation_id":"69a5adb7-48da-4aa6-8f17-3c6f276e1883","resolution":{"observed_at":"2026-08-06T23:20:40.147851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:40.224749Z","title":"Knowledge distillation: A survey,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:40.224749Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:9a5183c25eadd57bd3e8e60bb78b70e0cf77dccf7a64634936d061efe9b8d625","observation_id":"3413ee08-ef65-43cd-8836-74ff425cf13a","resolution":{"observed_at":"2026-08-06T23:20:40.224749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:40.256509Z","title":"Learning to prompt for vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:40.256509Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:769ce114e228d95a547175422e2b6d61f26f0fd976686a28891e7f7f818c8cdc","observation_id":"6c34589a-fadf-4e8d-b1de-24d3c071bf2f","resolution":{"observed_at":"2026-08-06T23:20:40.256509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:40.343811Z","title":"Conditional prompt learning for vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:40.343811Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:556b059ab333e9405ea0ae12f3bf82f056657f47cd3e091d56f76125e01aa93a","observation_id":"c730a9a4-07bb-4d04-a6c0-60deb0a25649","resolution":{"observed_at":"2026-08-06T23:20:40.343811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:40.389296Z","title":"Distilling large vision-language model with out-of-distribution generalizability,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:40.389296Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:513c8bfdbe47df28539b84e3effa176ae165f335256ced28ae74d5338dd4b841","observation_id":"0117a9a1-ae1a-4a74-b081-7da2b147ab32","resolution":{"observed_at":"2026-08-06T23:20:40.389296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:40.456900Z","title":"Domain adaptation via prompt learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:40.456900Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:03d87595ebaa6a2386dd3420f10c6eb771b25d909e9ff51274947a82d39443ee","observation_id":"dd44a1e7-b84f-452e-adc3-3cc14ca91706","resolution":{"observed_at":"2026-08-06T23:20:40.456900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:40.506726Z","title":"Split to merge: Unifying separated modalities for unsupervised domain adaptation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:40.506726Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:431138139b83c42bafc731a7c91cdb371b32b36541b5d3d545de7c10cd727b4f","observation_id":"ad1eb00f-bcdb-43c2-a262-0a275bd4d64a","resolution":{"observed_at":"2026-08-06T23:20:40.506726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:40.545192Z","title":"Domain-agnostic mutual prompting for unsupervised domain adaptation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:40.545192Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:1bc4ccc225e14108e12e07b67e78acf140ad6cad31b2ab7ac1ac06e043560151","observation_id":"ae72cf7b-bd79-47e2-bc6a-98725708abc2","resolution":{"observed_at":"2026-08-06T23:20:40.545192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:40.600472Z","title":"Soft prompt generation for domain generalization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:40.600472Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:6a0f121530911e0e6fe8cf1cd13cea6db55b5759adcfa8e160cd753c28c47ae3","observation_id":"a0ba8477-0683-4e25-83ff-60832f465caa","resolution":{"observed_at":"2026-08-06T23:20:40.600472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:40.624234Z","title":"Leverag- ing vision-language models for improving domain generalization in image classification,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:40.624234Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:22ec2e6bfe681fa4894be7a663f93f14ab5c96cc07b976a26a697411939c3f4b","observation_id":"2212ea7e-4c94-4184-b0f8-2134189ebdcc","resolution":{"observed_at":"2026-08-06T23:20:40.624234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:40.680021Z","title":"Practicaldg: Perturbation distillation on vision-language models for hybrid domain generalization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:40.680021Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:cc97f6a81928c1592dc1d7ec14552c968cfdff168aed3d9f3df802f9da06b9ff","observation_id":"13a63d05-48e5-4755-8566-39d743689262","resolution":{"observed_at":"2026-08-06T23:20:40.680021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:40.721433Z","title":"Test-time prompt tuning for zero-shot generalization in vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:40.721433Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:3b75ed6f3e62af9fc2c7ceaacb2a567f2194573ebeee198090e0edabf89df231","observation_id":"60d88dc5-4636-4f61-b02b-1f86f18dd2e6","resolution":{"observed_at":"2026-08-06T23:20:40.721433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:40.774011Z","title":"Efficient test-time adaptation of vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:40.774011Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:4c131f71642c2fcc56d0eba5c56e3f7a9037521076a9801882c3c8422cbce4f9","observation_id":"8520547f-b83a-4aaa-a65a-bcdefb5a9b38","resolution":{"observed_at":"2026-08-06T23:20:40.774011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:40.842636Z","title":"Diverse data augmentation with diffusions for effective test-time prompt tun- ing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:40.842636Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:3e71e39e97eda635f7ea0c06aa64ff82eb08b873c206e47a269475b10f4e96fe","observation_id":"d53d0a61-08a5-49f1-b834-b8642917acf1","resolution":{"observed_at":"2026-08-06T23:20:40.842636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:40.944733Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:40.944733Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:b2ef5156725f57a29cf8079f03b006627fb72b26b00211582e87d793c784ba16","observation_id":"fea55d91-b8bc-43bb-807e-860c95035e33","resolution":{"observed_at":"2026-08-06T23:20:40.944733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10936","last_updated":"2022-07-16T01:27:59Z","snapshot_observed_at":"2026-08-18T08:41:13.372775Z","submitted_at":"2022-02-18T15:15:46Z","title":"A Survey of Vision-Language Pre-Trained Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10936","snapshot_observed_at":"2026-08-06T23:20:40.995438Z","title":"A survey of vision-language pre-trained models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:40.995438Z"},"links":{"cited_paper":"/paper/2202.10936","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:d83a1fe6922030c162417a57183535e184711b0b9c463b6a14caefe00107c995","observation_id":"e4a9cd1b-e7b5-4309-9357-4c2ee836d135","resolution":{"observed_at":"2026-08-06T23:20:40.995438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:41.074381Z","title":"Ex- ploring the frontier of vision-language models: A survey of current methodologies and future directions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:41.074381Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:099031277b20e008e6a167fd29251cd9ee81868fd1c9ce2b7970449034f6502c","observation_id":"3324dcae-ee1e-4b99-83c1-370f8004d964","resolution":{"observed_at":"2026-08-06T23:20:41.074381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:41.144735Z","title":"Domain generalization by mutual-information regularization with pre-trained models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:41.144735Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:4163c90473f00bf4b573468e547972402edbd9b7dfe04115fa331421315d650b","observation_id":"fd861b3c-e761-460c-a5c5-d9aad627b03e","resolution":{"observed_at":"2026-08-06T23:20:41.144735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:41.188062Z","title":"Clipood: Generalizing clip to out-of-distributions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:41.188062Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:1c83c2ad38cac09651f0008c21a927e7b45d50e7c2fc3b1b886867ff71a4d005","observation_id":"1a3bf596-afdd-4494-94a2-19f54bfdd053","resolution":{"observed_at":"2026-08-06T23:20:41.188062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:41.226838Z","title":"Towards calibrated robust fine-tuning of vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:41.226838Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:66695ff38444cfae3e54e56cd7da7aa928d02d1d7a4ddfdcb613dca70d472aa2","observation_id":"84e3fa5a-93d1-4f2f-87ca-24eb6c37bc81","resolution":{"observed_at":"2026-08-06T23:20:41.226838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:41.289832Z","title":"Dual memory networks: A versatile adaptation approach for vision- language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:41.289832Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:ba146b3bb5bb6504be84b3d5e24db95b5ed5251f348500f5d92d25be8b523486","observation_id":"0174b178-f089-4cf8-93a1-32383009e82f","resolution":{"observed_at":"2026-08-06T23:20:41.289832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:41.344217Z","title":"A survey of transfer learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:41.344217Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:7e409c8d99c2c828e288f052064985ef18bb53109b0179054a0d4946130a4570","observation_id":"84ae0bd5-203f-45af-83c0-2c63dc982d16","resolution":{"observed_at":"2026-08-06T23:20:41.344217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:41.387676Z","title":"A survey on deep transfer learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:41.387676Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:74d4a4ca069ab87345bfebaadd84e0c7747008393fb9b0f2d8a471bcde6d4c84","observation_id":"b85e4731-08f2-455a-93e7-952bd449380d","resolution":{"observed_at":"2026-08-06T23:20:41.387676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-14T19:47:04.330126Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-06T23:20:41.475059Z","title":"Deepseek llm: Scaling open- source language models with longtermism,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:41.475059Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:36db4965e378ed6eae047187e92104cef16d81acc956239633403f72b49f4fc4","observation_id":"072a51b3-f6a8-446f-9d5f-eb6b72537f32","resolution":{"observed_at":"2026-08-06T23:20:41.475059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T23:20:41.568162Z","title":"Qwen2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:41.568162Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:8c9cb30452617ef9f777a189d2b5afea204b37f591732467b945fc122fd7055f","observation_id":"90e20ec9-e32f-490b-9cb0-d840bcaa4924","resolution":{"observed_at":"2026-08-06T23:20:41.568162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:41.602953Z","title":"Introducing qwen-7b: Open foundation and human- aligned models (of the state-of-the-arts),","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:41.602953Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:d46c6f974bd2728ee671f5a90c15faf5b425c092087f92a890522dfeae8b7c64","observation_id":"ae377e9f-f9cd-428b-9467-7e1bede9ece4","resolution":{"observed_at":"2026-08-06T23:20:41.602953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:20:41.659767Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:41.659767Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:9969440e24c0b7be0be800629ec43ab7a9a7784011fdd81c7b486750a481b4c5","observation_id":"1484648b-b95b-48c3-9c63-cf9bb66cd874","resolution":{"observed_at":"2026-08-06T23:20:41.659767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-06T23:20:41.740322Z","title":"Deepseek-vl: towards real-world vision- language understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:41.740322Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:dfb76872a443f0f9694eb36253bb1b7d16cfa8a69ae06f6e2ea8a9c07b37a9db","observation_id":"901bb4a0-b357-49bb-98a1-89f12a142bfa","resolution":{"observed_at":"2026-08-06T23:20:41.740322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T23:20:41.819879Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:41.819879Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:8afb2610714f2c6cbcd331e79be8a645e484247d8b135c2540ab3aedb93417ec","observation_id":"f150a74a-fef1-4e92-ba32-21a6ffaf3fe6","resolution":{"observed_at":"2026-08-06T23:20:41.819879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T23:20:41.954306Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:41.954306Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:0c039f7c46af7032817769d5165f372ffd2ae9d841422b4c141ba99e358b3642","observation_id":"73085743-7387-458f-a3a8-e3d1cfd37be7","resolution":{"observed_at":"2026-08-06T23:20:41.954306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:41.995187Z","title":"Contrastive learning of medical visual representations from paired images and text,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:41.995187Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:02aa7f372c0ad1df28fb8bd2698cbc2ca43d3ee1eb49e25f5a6703de829a4a4e","observation_id":"ac730f15-8e0c-4059-a6c9-200a79e9ef55","resolution":{"observed_at":"2026-08-06T23:20:41.995187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:42.066639Z","title":"Transfer learning,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:42.066639Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:13caa5560094bc5be6ccd97bda82bbfcc9e327baa052754f6372110a00285457","observation_id":"4405ce4d-a14c-45e3-bad3-8e4a806f6a9b","resolution":{"observed_at":"2026-08-06T23:20:42.066639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:42.187019Z","title":"Conditional adversarial domain adaptation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:42.187019Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:916c3da710c6b0db13b65023b8f4cc8342d501ebd4740d8e9dcb79e796349512","observation_id":"7e2abf42-0a08-4c19-9285-78731c5e2f7c","resolution":{"observed_at":"2026-08-06T23:20:42.187019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:42.324035Z","title":"Transfer independently together: A generalized framework for domain adaptation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:42.324035Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:2671f902590cdcfc2b73a5b843788c0ce4f5729c315db0949f145dd035b0b5e0","observation_id":"f246715b-32b0-45f9-a59e-951ab2208ddf","resolution":{"observed_at":"2026-08-06T23:20:42.324035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:42.408370Z","title":"Maximum density divergence for domain adaptation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:42.408370Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:2e2f6f4b458263262c16d3d969e6a9415207fa441bffa85bb610ead147ab69ed","observation_id":"615cd23b-d1ac-4b61-b271-1173099edef5","resolution":{"observed_at":"2026-08-06T23:20:42.408370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:42.475387Z","title":"Divergence- agnostic unsupervised domain adaptation by adversarial at- tacks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:42.475387Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:3509a9af5b1a812591ace94352c2796e9425b731ea114e7eb7725536f6a5285b","observation_id":"78af486c-81a2-4a18-a473-a67fdc232252","resolution":{"observed_at":"2026-08-06T23:20:42.475387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:42.574747Z","title":"Deep transfer metric learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:42.574747Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:a1bd91af39d838650751ddbfa8dbdecba2db63bab29629466b582355f508447b","observation_id":"b4f3661c-3d7a-4f3b-9a49-456804a11052","resolution":{"observed_at":"2026-08-06T23:20:42.574747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:42.682425Z","title":"Mind the class weight bias: Weighted maximum mean discrepancy for unsupervised domain adaptation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:42.682425Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:9774da77013136d0d0a4d08c3ca894ca8d2e18299a3f8791b88a2960874b1ee1","observation_id":"4decba84-85f7-4e9f-a1aa-5dd5696d7dfb","resolution":{"observed_at":"2026-08-06T23:20:42.682425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:42.779301Z","title":"Unsupervised domain adaptation by backpropagation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:42.779301Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:fbcb835773606cb01959ab740ddcc8be9aab9e41e784fcc4e2154f806a160433","observation_id":"82a4e28d-97f0-4728-9dae-07f8e948377c","resolution":{"observed_at":"2026-08-06T23:20:42.779301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:42.875730Z","title":"Domain generalization: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:42.875730Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:8794d679587574be779d6386bfa53c3db4ad8f9eb940f236a6ca959f45b0ceca","observation_id":"a3dfb6ba-8df4-4677-856f-e01b3b44d751","resolution":{"observed_at":"2026-08-06T23:20:42.875730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:43.035674Z","title":"Learning transferrable and interpretable representations for domain generalization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:43.035674Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:9895d22bf672972516c7a6368e2df02d46d2820bd8a0039ca00fc9def9f2605b","observation_id":"fb5c9470-1636-4928-a693-f038f4b14f32","resolution":{"observed_at":"2026-08-06T23:20:43.035674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:43.117727Z","title":"Domain gener- alization via invariant feature representation,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:43.117727Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:bdbddbaab3501bd306aca6540744783dc75e87c450e87af5fd6d6d9fefbcf29c","observation_id":"0e9839eb-e912-41c2-b71b-53215037126d","resolution":{"observed_at":"2026-08-06T23:20:43.117727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:43.158769Z","title":"Energy-based domain generalization for face anti-spoofing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:43.158769Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:3c4efd10b3c9b30344373a075e3520bbdc463baecfb9866f57526334a8f3d17a","observation_id":"1a725711-3a09-46cb-ab7a-add92cb2ee8c","resolution":{"observed_at":"2026-08-06T23:20:43.158769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:43.246528Z","title":"Deep domain generalization via conditional invariant adversar- ial networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:43.246528Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:28fb0d9004d35d702b9b2367a4eca90622cfa4e64a5d8b3cb5b94373c157676f","observation_id":"0f6a31ae-e6c5-4bcf-9ad0-484430e2b2d9","resolution":{"observed_at":"2026-08-06T23:20:43.246528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:43.323523Z","title":"Domain general- ization via entropy regularization,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:43.323523Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:68fdc8ab83b6f90b28c1050c5b1bb123817439dd0e48f7530b36cbaa64d0b7ec","observation_id":"2d20465d-734c-4fce-969d-09a3a4ad21f0","resolution":{"observed_at":"2026-08-06T23:20:43.323523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:43.384313Z","title":"Learning to gen- eralize: Meta-learning for domain generalization,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:43.384313Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:37b2cedfe54ddd88503d95890aa119e46ba5d897324f4ef123bff227436f235c","observation_id":"a25856cd-88a0-4124-ac8a-a337688633f8","resolution":{"observed_at":"2026-08-06T23:20:43.384313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:43.485464Z","title":"Metareg: Towards domain generalization using meta-regularization,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:43.485464Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:84893e12c241dec2cbb8729cd8e3c58f2acc89c14460a25a7835b1f4a8be4bec","observation_id":"c1a4ddf9-1155-4aeb-b18c-3a03ca17568e","resolution":{"observed_at":"2026-08-06T23:20:43.485464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:43.577098Z","title":"A comprehensive survey on test- time adaptation under distribution shifts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:43.577098Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:25db70118af02ca35b6b7d1470f03f2ae7b2af7ec8a9d187fb9d9a17f514b516","observation_id":"316ccb69-6cfb-4d8d-813a-8a448e7ffd82","resolution":{"observed_at":"2026-08-06T23:20:43.577098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10726","last_updated":"2021-03-18T17:58:01Z","snapshot_observed_at":"2026-08-16T06:30:33.794820Z","submitted_at":"2020-06-18T17:55:28Z","title":"Tent: Fully Test-time Adaptation by Entropy Minimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10726","snapshot_observed_at":"2026-08-06T23:20:43.633642Z","title":"Tent: Fully test-time adaptation by entropy minimization,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:43.633642Z"},"links":{"cited_paper":"/paper/2006.10726","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:722557f7f81c1daf8c4c074bb9f037bbfa82642cfd47bbd115299b4de49bad7e","observation_id":"b3d674df-c201-4aed-b0f8-184aa6ae414d","resolution":{"observed_at":"2026-08-06T23:20:43.633642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:43.719500Z","title":"A comprehensive survey on source-free domain adaptation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:43.719500Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:064c5bf5e88722edb07747687b5fbb533581d670f7556613440eb949cee658b0","observation_id":"91514eab-b688-4466-a888-2f852aaa068d","resolution":{"observed_at":"2026-08-06T23:20:43.719500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:43.824764Z","title":"Source-free active domain adaptation via energy-based locality preserving transfer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:43.824764Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:82e3e02e02abf8d28f87b5957af9322a2caf1e1bbe1babb6994b3da11e824aae","observation_id":"6c60dc24-e372-4ec9-ae2a-f1fc830660a4","resolution":{"observed_at":"2026-08-06T23:20:43.824764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:43.956479Z","title":"Generalizing from a few examples: A survey on few-shot learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:43.956479Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:f7b8a20bae5513a9dee41dfc991c1a46cecf7a978e9c33450196943767d6635a","observation_id":"1fd97b8b-af99-4b55-81b8-031abef4929e","resolution":{"observed_at":"2026-08-06T23:20:43.956479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:44.275625Z","title":"Leveraging the invariant side of generative zero-shot learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:44.275625Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:37dff79c7acb50e993291decae6fd3b685a11e072336c8fc97365343c35866ba","observation_id":"3fb8cf06-d8e4-4edd-a73f-953692166c3e","resolution":{"observed_at":"2026-08-06T23:20:44.275625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:44.377912Z","title":"Visual prompt tuning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:44.377912Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:6d98eb02bc88cc97a4c61e70739ea9ed2f630f34d7fd1bda0eb8412ace422c98","observation_id":"c83ec977-e4e7-436b-a033-f78faf10f8e0","resolution":{"observed_at":"2026-08-06T23:20:44.377912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:44.431145Z","title":"Maple: Multi-modal prompt learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:44.431145Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:6ee7faeeb55512059041d29ecd8912c5759caa3a14976697261234a781922cf8","observation_id":"b0fb0514-8329-45b5-90b7-18abfaf27ed0","resolution":{"observed_at":"2026-08-06T23:20:44.431145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07225","last_updated":"2022-10-13T17:50:24Z","snapshot_observed_at":"2026-08-18T09:28:49.447974Z","submitted_at":"2022-10-13T17:50:24Z","title":"Unified Vision and Language Prompt Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07225","snapshot_observed_at":"2026-08-06T23:20:44.558520Z","title":"Unified vision and language prompt learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:44.558520Z"},"links":{"cited_paper":"/paper/2210.07225","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:c0d124ff9101cd028751e6a9c51d2639891b32299e55454b7aacbef8aa3a0ca3","observation_id":"a4721250-0fee-4c53-9569-210c1669cab5","resolution":{"observed_at":"2026-08-06T23:20:44.558520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:44.651797Z","title":"Dual modality prompt tuning for vision-language pre-trained model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:44.651797Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:78cbc2473591f53b8c775352ed16cf06a67dcdc616b58e0a1b7fdd34d88eb99d","observation_id":"b2bd8c9e-d60c-4c84-8f5a-b7c117b1db6d","resolution":{"observed_at":"2026-08-06T23:20:44.651797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:44.806947Z","title":"Distribution-aware prompt tun- ing for vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:44.806947Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:561d0a62cb9a90d30dc52d6e905529cd2fd73a9f3b60f0e3e6692dd84dd2d887","observation_id":"985cb79e-667c-47b9-859c-a893fffea2cd","resolution":{"observed_at":"2026-08-06T23:20:44.806947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17274","last_updated":"2022-06-03T17:52:04Z","snapshot_observed_at":"2026-08-18T15:22:56.094984Z","submitted_at":"2022-03-31T17:59:30Z","title":"Exploring Visual Prompts for Adapting Large-Scale Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17274","snapshot_observed_at":"2026-08-06T23:20:44.918777Z","title":"Ex- ploring visual prompts for adapting large-scale models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:44.918777Z"},"links":{"cited_paper":"/paper/2203.17274","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:9d01ed28b15ade0368b7a47c6dc45c0f760eeaa2988c39beaa6252e80450ed2d","observation_id":"4201aed3-822e-4e97-8a35-cf388bf94315","resolution":{"observed_at":"2026-08-06T23:20:44.918777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:45.035033Z","title":"Unadversarial examples: Designing objects for ro- bust vision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:45.035033Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:9cc50555fdb2812730e5cb2715db981b62cde9cd4d83084b1e384bb3f50e084c","observation_id":"f2ff2722-9543-43f8-8462-38b15a59651c","resolution":{"observed_at":"2026-08-06T23:20:45.035033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:45.071593Z","title":"Dept: Decoupled prompt tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:45.071593Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:f0d18d93c14b887bb87d2487e60fe3c3f35c081a44b0bd1c1e2d2a79c67a3799","observation_id":"848c9a6f-7c5e-41a4-b6b7-37fe57634a3d","resolution":{"observed_at":"2026-08-06T23:20:45.071593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13443","last_updated":"2025-03-17T17:59:27Z","snapshot_observed_at":"2026-08-16T19:05:02.437016Z","submitted_at":"2025-03-17T17:59:27Z","title":"DPC: Dual-Prompt Collaboration for Tuning Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2503.13443","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13443","snapshot_observed_at":"2026-08-06T23:21:09.902747Z","title":"DPC: Dual-Prompt Collaboration for Tuning Vision-Language Models","venue":"cs.CV","work_id":"2e975a30-2dc9-482b-9106-7d2d6d783288","year":2025},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:45.177580Z"},"links":{"cited_paper":"/paper/2503.13443","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:56dc5e91baccee9ca56e55aea52d4462d6cad7bc6ee4095ac2589014c80bf2d3","observation_id":"5497a4d9-41bd-4c6c-a768-e4124384390f","resolution":{"observed_at":"2026-08-06T23:21:10.034687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00345","last_updated":"2024-06-01T07:46:42Z","snapshot_observed_at":"2026-08-16T13:47:12.117586Z","submitted_at":"2024-06-01T07:46:42Z","title":"DeCoOp: Robust Prompt Tuning with Out-of-Distribution Detection","version":1},"cited_work":{"arxiv_id":"2406.00345","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.00345","snapshot_observed_at":"2026-08-06T23:21:09.683930Z","title":"DeCoOp: Robust Prompt Tuning with Out-of-Distribution Detection","venue":"cs.CV","work_id":"a5f86017-74e6-464f-81c4-4ea4de6def2a","year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:45.289437Z"},"links":{"cited_paper":"/paper/2406.00345","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:a3cdf1e240a3d79324dd083a7dc07a9a6fb27e275c63db2773d20ade2ba3de66","observation_id":"e900055a-1ca2-4d6f-b83a-2b74489640d6","resolution":{"observed_at":"2026-08-06T23:21:09.751606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:45.394357Z","title":"Robust fine-tuning of zero-shot models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:45.394357Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:4fa30fcabeda97c26fd34fe87cf957a92b0ba7180474036f83a2997bd14f8bd9","observation_id":"346b9914-6814-48ab-9153-4bd6b1eccc10","resolution":{"observed_at":"2026-08-06T23:20:45.394357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:45.565675Z","title":"Visual-language prompt tuning with knowledge-guided context optimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:45.565675Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:efc5a7ab905e194c54e8cc43879471a6d5eaae6a36c37d088c72a70e5a4d4abf","observation_id":"f4442fcc-bb02-4cb4-96bd-990bc291881c","resolution":{"observed_at":"2026-08-06T23:20:45.565675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:45.651501Z","title":"Prompt-aligned gradient for prompt tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:45.651501Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:083bd7d03e2703019f2545274ffc9820c0f5ba3c9b4cccfb536b86b6f6fd9535","observation_id":"6fb783ce-8539-498e-aa97-030c0585cdff","resolution":{"observed_at":"2026-08-06T23:20:45.651501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:45.754740Z","title":"Self-regulating prompts: Foundational model adaptation without forgetting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:45.754740Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:6dd96d53652375b46ca3315c7cf30a8cf2ad375e8a247fe7312860f4881165cd","observation_id":"feea4d66-ae11-44e8-986b-4d77e5d280ac","resolution":{"observed_at":"2026-08-06T23:20:45.754740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:45.875194Z","title":"What does a platypus look like? generating customized prompts for zero-shot image classification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:45.875194Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:b85e03fdefa15d383c16404a7bb94c6b47e27e72a65cffa3a22d81878cd97c30","observation_id":"0777e938-b2bf-4457-b9bf-46104ee71b9a","resolution":{"observed_at":"2026-08-06T23:20:45.875194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:45.999659Z","title":"Learning to prompt with text only supervision for vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:45.999659Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:3fbb4ae0c9021aa7d4f2f19ecdf2557ddd65be1e92d6e52a3662a5fd48f2f5a2","observation_id":"a617e2cd-3128-47ea-8983-3db2522c4941","resolution":{"observed_at":"2026-08-06T23:20:45.999659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:46.064894Z","title":"Ad-clip: Adapting do- mains in prompt space using clip,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:46.064894Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:0d92d2fca471ff5b3780301d985bfc1bb7b6a0ef4e5a553e36cb2338cd16346a","observation_id":"9fad9af0-0a91-4858-acfa-1c87e0d2fe2c","resolution":{"observed_at":"2026-08-06T23:20:46.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:46.139261Z","title":"Stylip: Multi-scale style-conditioned prompt learning for clip- based domain generalization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:46.139261Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:8f1ba3500a2016a9a57bf39eb0983b7e1f5fa338b86ed6889518efbb8f3f6e71","observation_id":"f9bdeed2-8967-44bb-8555-29be623c3f37","resolution":{"observed_at":"2026-08-06T23:20:46.139261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:46.210328Z","title":"Enhancing domain adaptation through prompt gradient alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:46.210328Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:8bfd4de2bb9eba8935a185adc55a6eb823b60a2cb1f1480a0da4d42937841807","observation_id":"ba4a97d9-b34f-465b-9d5f-6c6443a6b2bd","resolution":{"observed_at":"2026-08-06T23:20:46.210328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02586","last_updated":"2024-08-13T04:04:26Z","snapshot_observed_at":"2026-08-19T14:51:59.189374Z","submitted_at":"2024-05-04T06:53:18Z","title":"Enhancing Vision-Language Models Generalization via Diversity-Driven Novel Feature Synthesis","version":2},"cited_work":{"arxiv_id":"2405.02586","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.02586","snapshot_observed_at":"2026-08-06T23:21:09.424138Z","title":"Enhancing Vision-Language Models Generalization via Diversity-Driven Novel Feature Synthesis","venue":"cs.CV","work_id":"683b2fec-3a48-4159-b878-e72f0380a0e4","year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:46.315371Z"},"links":{"cited_paper":"/paper/2405.02586","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:272ab6fc2b0c00db92fdbb0e8ee21eee506b27c5ae3178d876d6d4f9e4ee674f","observation_id":"0b38bfb6-ca77-4eab-9ba1-c165d11b0cc4","resolution":{"observed_at":"2026-08-06T23:21:09.514216Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:46.384808Z","title":"Dis- entangled prompt representation for domain generalization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:46.384808Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:4bf7026e1b0e696a23b32ba0b05707b17eec5884080f32decc497e6436e71317","observation_id":"78be2ee6-8305-4a8a-bba6-ceb9c187d523","resolution":{"observed_at":"2026-08-06T23:20:46.384808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:46.460566Z","title":"Unknown prompt the only lacuna: Unveiling clip’s potential for open domain generalization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:46.460566Z"},"links":{"citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:9e1d45cd6f3f6a0392331488410355da61893f41a336cadcb126aba84bfdb9be","observation_id":"e45369a3-7a90-42bb-a79f-e9bfa25995ff","resolution":{"observed_at":"2026-08-06T23:20:46.460566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":97,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":297},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 297 outbound references and 4 inbound Pith citation observations for arXiv:2506.18504."}